研究人员开发了 SliceScheduler,一个新颖的动态算子级调度系统,旨在提高多租户模型服务的效率。该系统利用全局映射图提供算子依赖关系和执行状态的实时、集群范围视图。通过使用全局模拟器,SliceScheduler 可以预测算子执行和内存演变,从而在遵守服务水平协议并避免内存违规的情况下,利用碎片化的空闲切片。SliceScheduler 作为 PyTorch 后端实现,在令牌吞吐量方面取得了显著的改进,与现有方法相比,令牌吞吐量提高了 2.29 倍,同时 SLA 违规率极低。 AI
影响 提高大型语言模型服务基础设施的 GPU 利用率和令牌吞吐量。
排序理由 关于模型服务效率新系统的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →