PulseAugur
实时 04:03:05
English(EN) MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

MaskAttn-SDXL 增强了文本到图像扩散模型中的区域级控制

研究人员推出 MaskAttn-SDXL,这是一个新颖的即插即用模块,旨在增强文本到图像扩散模型中可控的区域级生成。该模块将 token 条件的空间门控注入到 SDXL 等现有模型的交叉注意力机制中,而无需更改核心架构或采样过程。通过稀疏化 token 与位置的交互,MaskAttn-SDXL 旨在抑制不相关的绑定并提高组合的可靠性,从而解决全局指标常常无法捕捉的属性混合和空间关系违规等问题。 AI

影响 提高了文本到图像生成的可控性和可靠性,有望带来更准确、更细致的视觉输出。

排序理由 该集群包含一篇详细介绍扩散模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

MaskAttn-SDXL 增强了文本到图像扩散模型中的区域级控制

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan ·

    MaskAttn-SDXL:可控区域级文本到图像生成

    arXiv:2509.15357v3 Announce Type: replace-cross Abstract: Diffusion models have achieved strong results in text-to-image generation, but important limitations remain as prompts become more structured and multi-object. On the architecture side, U-Net backbones are efficient and st…