研究人员开发了 STS,一种新颖的稀疏注意力机制,旨在提高大型语言模型 (LLM) 的效率,而无需重新训练模型。STS 利用一个较小的草稿模型来预测较大目标模型的重要令牌,从而能够动态构建稀疏性掩码,修剪昂贵的注意力计算。这种方法实现了显著的加速,在 NarrativeQA 基准测试中,STS 在大约 90% 的稀疏性下实现了 2.67 倍的加速,同时与密集注意力相比,准确性损失可忽略不计。 AI
影响 这种方法可以显著降低运行大型语言模型的计算成本,从而实现更复杂的代理应用程序和更广泛的部署。
排序理由 这是一篇详细介绍改进 LLM 效率的新技术方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →