研究人员开发了Astrolabe,一个旨在优化大语言模型(LLM)服务的新型调度系统。该系统采用随机预测引导的方法,在无需昂贵的基于迁移的重新平衡的情况下,平衡多个LLM实例之间的负载。Astrolabe结合了响应长度估计、延迟预测和power-of-two-choices调度策略,以增强负载平衡并降低延迟。实验表明,Astrolabe可以匹配或超越现有基线的性能,显著降低平均和P99的首个token时间和端到端延迟,同时还减少了预测器的CPU使用率。 AI
影响 优化大语言模型服务基础设施,可能降低成本并改善AI应用的响应时间。
排序理由 该集群包含一篇详细介绍LLM服务新调度系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →