本文详细介绍了在大语言模型的多轮对话场景中,通过 KV 缓存复用实现的显著性能提升。通过缓存先前轮次的键值张量,消除了冗余计算,从而将首个 token 的延迟最多降低 32%,吞吐量最多提高 40%。这项研究基于使用 480B 参数模型在 Mingxin FX100 上进行的测量,强调了这种优化对于高效长上下文推理部署的重要性,尤其是在高并发情况下。 AI
影响 降低了 LLM 的推理延迟并提高了吞吐量,改善了对话应用中的用户体验。
排序理由 技术案例研究,详细介绍了 LLM 推理的性能优化。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek R2
- KV cache
- Mingxin FX100
- Mingxin Technology
- PagedAttention
- Proceedings of the 29th Symposium on Operating Systems Principles
- Qwen3-Coder-480B-FP8
- Rodalies Barcelona line R3
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →