研究人员开发了一个名为 SelKV 的新颖框架,以解决大语言模型(LLM)中因键值(KV)缓存随上下文长度线性增长而导致的内存瓶颈问题。这种无需训练的方法采用双组分方法:一个软余弦门,根据语义相似性选择性地合并或丢弃 token;以及一个注意力比例补偿机制,以纠正合并引入的注意力不平衡。在仅使用 25% KV 缓存的 LongBench 基准测试上进行评估时,SelKV 表现强劲,尤其是在分组查询注意力(GQA)模型上,并在 100k token 时实现了 3.3 倍的解码速度提升,甚至在复杂的问答任务上超越了全缓存基线。 AI
影响 通过减少内存占用和提高解码速度来优化大语言模型(LLM)推理,可能支持更长的上下文窗口和更快的响应。
排序理由 详细介绍优化大语言模型(LLM)KV 缓存新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →