研究人员推出了一种新颖的前缀缓存机制 Tail-Replay,旨在提高混合大型语言模型(LLM)的效率。这些模型结合了全注意力(full-attention)和线性注意力(linear-attention)层来处理长上下文,但传统的前缀缓存难以处理这些层不同的状态管理。Tail-Replay 通过重放匹配前缀的短后缀来近似线性注意力状态,从而消除了对循环状态检查点的需求。这种方法实现了无约束的 token 级前缀重用,并在 LongBench 和 RULER 等基准测试中展示了显著的速度提升,推理速度比全预填充(full prefill)快高达 14.3 倍。 AI
影响 提高了混合 LLM 的推理效率,可能降低长上下文应用的成本并提高速度。
排序理由 详细介绍 LLM 新技术方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →