研究人员开发了RoLA,一种新颖的注意力机制,旨在提高用于视频生成的Diffusion Transformer(DiTs)的效率。该新方法通过结合稀疏局部分支和压缩全局分支来解决标准自注意力的二次缩放问题,特别克服了与3D旋转位置嵌入(RoPE)的兼容性挑战。RoLA将RoPE集成在低秩特征图之外,实现了真正的跨token聚合,无需额外的位置参数,并实现了线性时间的全局分支。实验表明,RoLA在90%的稀疏度下保持了生成质量,并在Wan2.1-14B等模型上实现了显著的推理加速。 AI
影响 RoLA的效率提升可能会加速高质量视频生成模型的开发和部署。
排序理由 该集群包含一篇详细介绍改进AI模型效率的新技术方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →