研究人员推出了一种新颖的方法 SketchSSM,通过近似状态读取来提高混合注意力模型的效率。该技术通过缓冲键值来减少 KV 缓存的增长并实现更大的解码批次,同时仍能保持准确性。SketchSSM 在 NVIDIA B300 和 Nemotron 3 Super 等硬件上实现了显著的加速和更高的解码吞吐量,优于标准的 vLLM 基线。 AI
影响 该方法可以显著提高 LLM 的推理速度和吞吐量,从而支持更大的模型和更快的处理速度。
排序理由 这是一篇详细介绍改进 LLM 效率新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →