研究人员开发了一个名为自索引注意力(Self-Indexing Attention)的新框架,旨在提高稀疏长上下文大型语言模型(LLM)推理的效率。这种无需训练的方法利用共享的变换域表示,允许使用可重用的令牌级索引,从而在预填充和解码阶段实现高效检索。该系统实现了显著的速度提升,实验表明在 5% 的注意力密度下,预填充速度最快可达 6.1 倍,解码注意力操作速度最快可达 10.3 倍,同时在 LongBench 和 RULER 等基准测试中保持接近密集注意力的性能。该框架还证明了与现有的 KV 缓存压缩技术和预训练稀疏注意力索引器兼容。 AI
影响 这种新方法可以显著加快长上下文 LLM 的推理速度,可能降低运营成本并支持新应用。
排序理由 该集群包含一篇详细介绍 LLM 推理新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →