研究人员开发了一种新颖的“通用上下文重用层”,它能够实现不同大型语言模型之间的 KV(键值)状态共享,即使这些模型具有不同的架构、分词器和规模。这种跨模型 KV 共享显著减少了预填充期间的冗余计算,从而节省了成本并提高了性能。例如,在 LongBench2 基准测试中,Qwen2.5 模型之间的 KV 状态共享提高了准确性,而 Qwen2.5 和 Gemma-2 模型之间的跨家族共享将预填充成本降低了高达 67%,同时对困惑度影响极小。在 Llama3.1 到 Qwen2.5 的场景中,该方法还显著降低了延迟,表明 KV 状态可以作为可转移的计算表示,从而在各种 LLM 推理工作流中实现“上下文迁移”。 AI
影响 通过实现异构 LLM 之间的 KV 状态共享,降低了推理成本和延迟,有望加速多智能体和复杂 LLM 工作流。
排序理由 学术论文,详细介绍了 LLM 推理的一种新颖技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →