一个名为 Prism 的新框架已被开发出来,用于改进高分辨率(特别是 2K)音视频联合生成模型的训练。传统的全注意力机制在更高分辨率下面临二次成本和冗余 token 的问题,稀释了学习信号。Prism 通过将 token 序列组织成时空宏区域,并根据局部内容、视频特征方差和音频到视频的交叉注意力范数动态调整注意力结构来解决这个问题。这种方法允许定制块形状,确保语义连贯性,并捕捉视觉内容和跨模态交互,从而实现了 2.5 倍的训练速度提升和更好的生成质量。 AI
影响 Prism 的动态稀疏注意力可以显著降低训练成本,并提高高分辨率音视频生成模型的质量。
排序理由 该集群描述了一篇关于用于 AI 模型训练的新颖框架的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →