研究人员调查了时间聚合和排名保留对大型语言模型解码时 KV 缓存压缩的影响。他们发现指数移动平均 (EMA) 聚合可以使评分器修改在驱逐级别无法区分,从而实现稳定的保留集。这促成了 InertiaKV 和 InertiaKV-Lazy 的开发,这些方法与完全刷新方法相比,将解码吞吐量提高了 1.34-1.46 倍。该研究还探讨了无评分解码,它在显著降低计算成本的同时保持了平均质量。 AI
影响 引入了提高 LLM 解码吞吐量和降低计算成本的方法。
排序理由 学术论文,详细介绍了 LLM 中 KV 缓存压缩的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →