MM-DiTs
PulseAugur coverage of MM-DiTs — every cluster mentioning MM-DiTs across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新方法可擦除 AI 图像生成模型中的不希望有的概念
研究人员开发了一种新的无微调概念擦除方法,用于多模态扩散 Transformer (MM-DiTs),这是一种先进的文本到图像生成模型。该技术直接操纵模型的内部表示,特别是针对文本条件语义表示最突出的中间块。通过提取和引导这些表示,该方法以最小的开销有效地消除了不希望有的概念,并且无需重新训练模型,在概念擦除和控制生成输出方面展示了最先进的性能。
-
ControlRef 框架提升多实例图像生成效率
研究人员推出 ControlRef,一个旨在提高多模态扩散 Transformer (MM-DiTs) 中布局引导多实例图像生成效率和精度的框架。该系统通过采用统一实例-布局控制 (UILC) 注意力掩码和新颖的锚定 4D-RoPE 位置编码,解决了先前方法如高计算成本和空间-频率折衷等局限性。实验表明,ControlRef 在保持最先进的视觉保真度和定位精度的同时,显著降低了推理延迟和内存开销。
-
新的 FairFlow 框架解决了文本到图像 AI 中的刻板印象偏见
研究人员开发了 FairFlow,一个旨在解决文本到图像扩散模型(特别是多模态扩散 Transformer (MM-DiTs))中刻板印象偏见的新框架。该研究确定了这些模型中充当“语义中心”并从文本提示传播偏见到视觉输出的特定层。FairFlow 在推理过程中干预这些确定的中心,注入学习到的“公平方向”来中和与性别、种族和交叉性相关的偏见,而不会显著影响生成质量或推理速度。
-
AnchorDiff 通过减少视觉泄露来改进 AI 概念锚定
研究人员推出了 AnchorDiff,一种新颖的免训练方法,旨在改进多模态扩散 Transformer (MM-DiTs) 中的概念锚定。该方法解决了“概念泄露”问题,即视觉注意力错误地溢出到非目标对象上,尤其是在概念视觉相似时。AnchorDiff 首先识别高置信度锚点,然后使用混合图传播技术来精炼定位并防止跨对象干扰。AnchorDiff 的有效性通过在标准数据集和新的多概念混淆数据集上的实验得到证明,显示概念泄露显著减少。