SD3.5
PulseAugur coverage of SD3.5 — every cluster mentioning SD3.5 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的CMO框架增强了文本到图像的组合生成能力
研究人员开发了一个名为相关加权多奖励优化(CMO)的新框架,以提高文本到图像模型的组合生成能力。该方法通过根据概念的相关性和难度自适应地加权概念奖励,解决了模型在单个提示中无法满足多个概念的挑战。通过将优化重点放在更难满足的概念上,CMO旨在确保所有请求的属性都能得到一致的生成。该框架已应用于SD3.5和FLUX等最先进的扩散模型,在多概念基准测试中显示出性能的提高。
-
新研究探讨扩散模型、偏差缓解和强化学习应用 · 跟踪 10 个来源
近期研究探讨了扩散模型的进展,重点关注理论基础、优化技术和偏差缓解。一篇论文介绍了贝叶斯信息受限扩散(BIRD)模型,解释了扩散模型如何通过限制信息来泛化,并确定了记忆与泛化之间的相界。另一项工作 D2PO 使用动态偏好学习优化扩散采样器,提高了感知质量,性能优于基于回归的方法。此外,一种名为 CO-ALIGN 的新方法使用概念图对齐来减少文本到图像模型中的偏差,同时保持生成完整性。其他研究还探讨了扩散采样中的数值稳定性和强化学习中扩…
-
新方法可从SD3.5等前沿图像模型中移除概念
研究人员开发了一种新方法,用于从SD3.5、Flux和Infinity等前沿图像生成模型中移除不希望有的概念。该技术通过用一个经过训练的转码器替换内部瓶颈层来实现,该转码器充当过滤器,可以在不降低图像质量的情况下禁用特定概念信号。这种持久的、原地修改实现了最先进的概念移除效果,并能抵御对抗性提示。
-
Mage 发布浏览器AI工作室,支持无限图像和视频创作
Mage 推出了新的浏览器AI工作室,旨在实现无限且无审查的图像和视频创作。该平台支持 Flux、SD3.5 和 Wan Video 等顶级模型,以及 Mage 的独家模型。主要功能包括跨多帧的角色一致性以及使用参考视频进行运动控制,所有创作均私密且可商用。
-
新方法解决文本到图像模型中的提示遗忘问题
研究人员在用于文本到图像生成的多模态扩散 Transformer (MMDiTs) 中发现了一个“提示遗忘”问题。这种现象发生是因为文本提示的语义表示在穿过模型更深层时会降级。为了解决这个问题,提出了一种名为“提示再注入”的新型无训练方法,该方法将早期层的提示表示重新引入到后期层。在 SD3、SD3.5 和 FLUX.1 等模型上进行的实验表明,该技术提高了指令遵循能力和整体生成质量。
-
新框架改进图像生成模型中的文本渲染
研究人员开发了TextAlign,一个旨在改进大型文本到图像生成模型文本渲染能力的新框架。该方法将文本渲染视为训练后偏好对齐问题,避免了对基础模型的架构更改。TextAlign利用基于视觉语言模型的层级奖励系统,在全局、单词和字形级别识别和惩罚渲染错误,从而在不影响整体图像质量的情况下提高OCR准确性。
-
新框架增强文本到图像模型与人类偏好的对齐
研究人员开发了两个新颖的框架,DIDR和RTDMD,以改进文本到图像生成模型与人类偏好的对齐。DIDR(Diff-Instruct with Diffused Reward)是一个无数据框架,可在扩散轨迹的所有噪声水平上优化奖励,从而提高图像保真度。RTDMD是一种两阶段方法,将分布匹配蒸馏与奖励引导的强化学习相结合,用于少步生成器。这两种方法在偏好、美学和构图指标方面都显示出显著的改进,其中RTDMD仅用几步推理即可在SD3、SD3…