一篇新的研究论文探讨了跨不同内存层级(GPU HBM、CPU DRAM、SSD)的 KV 缓存的最佳放置策略,以管理稀缺的 GPU 内存。该研究使用离散事件模拟器进行,发现内存分层可以支持显著更多的并发会话并降低成本,尽管放置策略本身对吞吐量的影响很小。评估了不同的策略,如近期性、重用频率和 EWMA,其中重用频率在代理和文档问答工作负载方面表现最佳,而近期性在聊天方面表现更好。 AI
影响 优化 KV 缓存放置可以显著提高 LLM 会话容量并降低运营成本。
排序理由 关于优化 LLM 推理基础设施的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →