研究人员开发了 FluidPD,一个旨在提高大型语言模型 (LLM) 服务效率和可靠性的新系统。FluidPD 通过引入原地弹性来应对 LLM 推理的预填充和解码阶段之间不断变化的需求的挑战。该系统使用 FluidToken 和 FluidRole 等机制,无需额外硬件即可动态调整资源和工作角色,从而在满足延迟服务水平目标 (SLO) 方面取得显著改进。 AI
影响 通过动态管理资源以满足延迟 SLO 来提高 LLM 服务效率和可靠性。
排序理由 该项目是一篇研究论文,详细介绍了一个用于 LLM 服务的新系统。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →