研究人员推出 MaskAttn-SDXL,这是一个新颖的即插即用模块,旨在增强文本到图像扩散模型中可控的区域级生成。该模块将 token 条件的空间门控注入到 SDXL 等现有模型的交叉注意力机制中,而无需更改核心架构或采样过程。通过稀疏化 token 与位置的交互,MaskAttn-SDXL 旨在抑制不相关的绑定并提高组合的可靠性,从而解决全局指标常常无法捕捉的属性混合和空间关系违规等问题。 AI
影响 提高了文本到图像生成的可控性和可靠性,有望带来更准确、更细致的视觉输出。
排序理由 该集群包含一篇详细介绍扩散模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MaskAttn-SDXL
- ScienceCast
- SDXL
- Transformer++
- U-Net
- Yu Chang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →