研究人员开发了HISA(Hierarchical Indexed Sparse Attention),一种新颖的即插即用索引器,旨在提高大型语言模型中稀疏注意力机制的效率。HISA通过引入一个两阶段的分层方法来解决现有方法中由平面token扫描引起的瓶颈:首先是粗粒度的块级过滤阶段,然后是token级精炼阶段。该方法在保持细粒度稀疏注意力质量的同时,显著提高了速度,在64K上下文长度下,在内核级基准测试中实现了高达3倍的速度提升。HISA已成功集成到DeepSeek-V3.2和GLM-5等模型中,无需进一步训练。 AI
影响 提高了具有长上下文窗口的LLM的效率,可能支持更复杂的任务和更快的处理。
排序理由 该集群描述了一篇详细介绍改进LLM效率新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →