研究人员引入了两种新颖的注意力机制,CoWindow Attention (CoWA) 和 MassAlloc Attention (MALA),旨在提高大型语言模型的计算效率。CoWA通过互补窗口将注意力分布在多个KV头中,在保持完全因果覆盖的同时实现稀疏注意力。MALA利用注意力的softmax统计数据选择性地执行后分数计算,从而优化计算。这两种方法在注意力操作方面都显示出显著的加速,CoWA的前向传播速度提高了7.4倍,MALA提供了2.2倍的加速,从而在不损害模型能力的情况下减少了训练FLOPs。 AI
影响 这些方法可以显著降低训练和运行大型语言模型的计算成本,从而实现更高效的开发和部署。
排序理由 该集群描述了关于LLM新注意力机制的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →