研究人员开发了一种新的文本到图像扩散 Transformer (DiTs) 可解释性框架,揭示了结构化文本模板标记的关键作用。这些通常被忽视的标记充当隐式语义寄存器,在图像生成过程中对物体身份进行因果维持。研究发现,提示语义在被这些模板标记读取之前,会间接注入到图像潜在空间中。这一理解催生了一种无需训练的剪枝规则,可以在对生成质量影响极小的情况下,将注意力计算量(FLOPs)降低 20%。 AI
影响 揭示了文本到图像模型如何处理语义,可能导致更高效的模型架构和剪枝技术。
排序理由 这是一篇研究论文,详细介绍了关于扩散 Transformer 内部机制的新发现。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Diffusion Transformers
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
- Data Influence Oriented Tree Search
- Text Template Tokens
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →