KV 缓存是大型语言模型的一个关键组成部分,它会随着处理的每个 token 而扩展,可能消耗大量 GPU 内存。本文探讨了四个可调参数,这些参数有助于管理 KV 缓存大小并将其保留在 GPU 上。一个特定参数会急剧降低长上下文回忆性能,将其从 91% 降至低至 13%。 AI
影响 优化 KV 缓存可以提高 LLM 推理速度和效率,从而在现有硬件上实现更大的上下文窗口。
排序理由 详细介绍优化 LLM 推理基础设施方法的技术文章。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →