研究人员开发了DPS,一个双精度大语言模型服务系统,它动态调整模型精度以优化KV缓存内存。通过在KV缓存需求高的时期切换到模型的低精度变体,DPS可以将未使用的权重内存重新用于KV缓存块。这种基于半统一内存(SUM)的方法,在保持FP16级别精度的同时,将持续吞吐量提高了3.3倍,有效pass@1提高了41个百分点。 AI
影响 这种双精度服务方法可以显著提高大语言模型的推理效率和吞吐量,尤其是在突发工作负载下。
排序理由 该集群描述了一篇关于大语言模型服务新颖系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →