PulseAugur
实时 13:11:08
English(EN) Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

SliceScheduler 提升多租户 LLM 服务 GPU 利用率

研究人员开发了 SliceScheduler,一个新颖的动态算子级调度系统,旨在提高多租户模型服务的效率。该系统利用全局映射图提供算子依赖关系和执行状态的实时、集群范围视图。通过使用全局模拟器,SliceScheduler 可以预测算子执行和内存演变,从而在遵守服务水平协议并避免内存违规的情况下,利用碎片化的空闲切片。SliceScheduler 作为 PyTorch 后端实现,在令牌吞吐量方面取得了显著的改进,与现有方法相比,令牌吞吐量提高了 2.29 倍,同时 SLA 违规率极低。 AI

影响 提高大型语言模型服务基础设施的 GPU 利用率和令牌吞吐量。

排序理由 关于模型服务效率新系统的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SliceScheduler 提升多租户 LLM 服务 GPU 利用率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang ·

    面向高效多租户模型服务的全球仿真引导动态算子调度

    arXiv:2608.15762v1 Announce Type: cross Abstract: Container-granularity scheduling leaves abundant short-lived idle slices within containers unexploited. Reallocating containers is too heavyweight to utilize such fine-grained opportunities under SLA constraints, and operator-leve…