SD3.5
PulseAugur coverage of SD3.5 — every cluster mentioning SD3.5 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的ASemConsist框架增强了文本到图像生成中的身份一致性
研究人员推出了一种新颖的ASemConsist框架,旨在在不影响每张图像的提示对齐的情况下,提高文本到图像生成中的身份一致性。该方法通过选择性地修改文本嵌入来实现这一点,重点关注保留与提示相关语义的填充嵌入。该框架还采用了一种自适应特征共享策略,仅对模糊的身份提示应用约束。开发了一种名为SeeSaw的新评估指标来衡量身份一致性和提示对齐之间的平衡,并且ASemConsist在与SD3.5和FLUX骨干集成时表现出卓越的性能。
-
新研究为文本到图像 AI 提供高级控制和安全性
两篇新研究论文提出了增强文本到图像生成模型控制和安全性的新颖方法。第一种方法 DiSCO,通过对比评分优化提示,提供了一种黑盒防御来防止生成不安全内容(NSFW),在保持图像质量的同时显著减少了有害输出。第二种方法 Concept Guidance (CoG) 是一种无需训练的方法,通过强化扩散模型中与概念相关的层来精确控制图像生成,在不改变模型本身的情况下提高了美学吸引力和局部连贯性。
-
新的RACER控制器提高了扩散模型的速度和可靠性 · 跟踪2个来源
研究人员开发了RACER,一种新的闭环控制器,旨在提高扩散模型的效率和可靠性。与盲目信任预测的先前方法不同,RACER分析预测之间的一致性,以确定何时以及在多大程度上信任它们。这种方法允许在不牺牲质量的情况下更积极地加速扩散采样,从而在SD3.5-Large、FLUX.1-dev、Wan2.1-14B和HunyuanVideo等各种模型中实现更快的生成速度。
-
新的光谱对齐方法解决了扩散模型的曝光偏差问题
研究人员开发了光谱对齐(SPA)方法,这是一种解决扩散模型中曝光偏差的新颖技术。该技术将中间预测的功率谱校准到预先计算好的先验,从而提高了迭代采样过程中的准确性。SPA是一种轻量级的、基于引导的方法,计算开销极小,并且可以与Classifier-Free Guidance (CFG) 等现有方法互补。该方法已在DDPM、ADM、SD2.0、SDXL、SD3.5和FLUX等各种扩散模型架构上展示了持续的改进。
-
新的CMO框架增强了文本到图像的组合生成能力
研究人员开发了一个名为相关加权多奖励优化(CMO)的新框架,以提高文本到图像模型的组合生成能力。该方法通过根据概念的相关性和难度自适应地加权概念奖励,解决了模型在单个提示中无法满足多个概念的挑战。通过将优化重点放在更难满足的概念上,CMO旨在确保所有请求的属性都能得到一致的生成。该框架已应用于SD3.5和FLUX等最先进的扩散模型,在多概念基准测试中显示出性能的提高。
-
新研究探讨扩散模型、偏差缓解和强化学习应用 · 跟踪 10 个来源
近期研究探讨了扩散模型的进展,重点关注理论基础、优化技术和偏差缓解。一篇论文介绍了贝叶斯信息受限扩散(BIRD)模型,解释了扩散模型如何通过限制信息来泛化,并确定了记忆与泛化之间的相界。另一项工作 D2PO 使用动态偏好学习优化扩散采样器,提高了感知质量,性能优于基于回归的方法。此外,一种名为 CO-ALIGN 的新方法使用概念图对齐来减少文本到图像模型中的偏差,同时保持生成完整性。其他研究还探讨了扩散采样中的数值稳定性和强化学习中扩…
-
新方法可从SD3.5等前沿图像模型中移除概念
研究人员开发了一种新方法,用于从SD3.5、Flux和Infinity等前沿图像生成模型中移除不希望有的概念。该技术通过用一个经过训练的转码器替换内部瓶颈层来实现,该转码器充当过滤器,可以在不降低图像质量的情况下禁用特定概念信号。这种持久的、原地修改实现了最先进的概念移除效果,并能抵御对抗性提示。
-
Mage 发布浏览器AI工作室,支持无限图像和视频创作
Mage 推出了新的浏览器AI工作室,旨在实现无限且无审查的图像和视频创作。该平台支持 Flux、SD3.5 和 Wan Video 等顶级模型,以及 Mage 的独家模型。主要功能包括跨多帧的角色一致性以及使用参考视频进行运动控制,所有创作均私密且可商用。
-
新方法解决文本到图像模型中的提示遗忘问题
研究人员在用于文本到图像生成的多模态扩散 Transformer (MMDiTs) 中发现了一个“提示遗忘”问题。这种现象发生是因为文本提示的语义表示在穿过模型更深层时会降级。为了解决这个问题,提出了一种名为“提示再注入”的新型无训练方法,该方法将早期层的提示表示重新引入到后期层。在 SD3、SD3.5 和 FLUX.1 等模型上进行的实验表明,该技术提高了指令遵循能力和整体生成质量。
-
新框架改进图像生成模型中的文本渲染
研究人员开发了TextAlign,一个旨在改进大型文本到图像生成模型文本渲染能力的新框架。该方法将文本渲染视为训练后偏好对齐问题,避免了对基础模型的架构更改。TextAlign利用基于视觉语言模型的层级奖励系统,在全局、单词和字形级别识别和惩罚渲染错误,从而在不影响整体图像质量的情况下提高OCR准确性。
-
新框架增强文本到图像模型与人类偏好的对齐
研究人员开发了两个新颖的框架,DIDR和RTDMD,以改进文本到图像生成模型与人类偏好的对齐。DIDR(Diff-Instruct with Diffused Reward)是一个无数据框架,可在扩散轨迹的所有噪声水平上优化奖励,从而提高图像保真度。RTDMD是一种两阶段方法,将分布匹配蒸馏与奖励引导的强化学习相结合,用于少步生成器。这两种方法在偏好、美学和构图指标方面都显示出显著的改进,其中RTDMD仅用几步推理即可在SD3、SD3…