研究人员开发了AgentKV,一种用于管理Agentic大型语言模型(LLM)中KV缓存的新方法。AgentKV解决了传统KV驱逐方法(依赖最近的token)未能考虑Agentic LLM在思考、行动和工具使用等不同阶段的多样化查询模式的问题。通过为每个阶段维护单独的查询缓冲区,AgentKV可以更有效地对相关缓存键进行评分和保留。与R-KV和Tri-attention等现有方法相比,这种方法提高了任务性能并增加了输出token吞吐量,在某些场景下甚至超过了全KV服务。 AI
影响 提高了LLM服务效率,可能支持更复杂的Agentic应用并降低计算成本。
排序理由 这是一篇详细介绍提高LLM效率的新颖方法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →