PulseAugur
实时 11:49:28
English(EN) TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO调度器通过考虑内存和计算约束来优化MoE服务

研究人员开发了TEMPO,一种新颖的感知时界调度器,旨在优化专家并行(EP)混合专家(MoE)模型的服务。与假设专家时间线性扩展的先前方法不同,TEMPO考虑了两种不同的约束:内存约束(HBM权重流)和计算约束(分组GEMM轮)。该系统将每个批次的调度形式化为一个固定成本时界问题,并高效地解决它以提高吞吐量并降低延迟,特别是在两种约束同时存在的情况下。 AI

影响 优化了MoE模型服务的效率,可能导致大型语言模型的推理速度更快和成本降低。

排序理由 这是一篇详细介绍优化AI模型服务新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

TEMPO调度器通过考虑内存和计算约束来优化MoE服务

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song ·

    TEMPO:在内存密集型和计算密集型模式下实现跨内存和计算的、感知制造周期的专家并行负载均衡

    arXiv:2608.13057v1 Announce Type: cross Abstract: In expert-parallel (EP) MoE serving, every layer synchronizes at the slowest GPU. Dispatchers balance token counts (EPLB, LPLB, UltraEP) or activated-expert counts (METRO), assuming expert time is linear in one. Measurements on tw…