一个名为 PowerSlider 的新系统已被开发出来,用于在波动的功率限制下优化 LLM 服务,这是由于需求响应要求,在 AI 推理集群中常见的问题。与优化静态能源或削减固定优先级层级的现有系统不同,PowerSlider 利用了 LLM 工作负载中的相位不对称性。它将预填充、思考和回答阶段进行分解,允许对每个阶段进行频率和 KV 缓存控制,以在功率受限时最大限度地减少性能损失。该系统利用了一种新颖的 Flex SLO 合约和一个可以在毫秒内重新求解的在线求解器,即使在显著降低功率的情况下也能确保持续的吞吐量和低延迟。 AI
影响 在功率限制下优化 LLM 服务效率,可能降低运营成本并提高电网紧急情况下的性能。
排序理由 该条目描述了一个用于优化 LLM 服务的新颖系统和算法,发表在 arXiv 论文中。[lever_c_demoted from research: ic=1 ai=1.0]
- California Independent System Operator
- demand response
- dynamic voltage and frequency scaling
- Flex SLO
- graphics processing unit
- Karush--Kuhn--Tucker (KKT)
- KV cache
- LLM
- PowerSlider
- SGLang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →