研究人员开发了TEMPO,一种新颖的感知时界调度器,旨在优化专家并行(EP)混合专家(MoE)模型的服务。与假设专家时间线性扩展的先前方法不同,TEMPO考虑了两种不同的约束:内存约束(HBM权重流)和计算约束(分组GEMM轮)。该系统将每个批次的调度形式化为一个固定成本时界问题,并高效地解决它以提高吞吐量并降低延迟,特别是在两种约束同时存在的情况下。 AI
影响 优化了MoE模型服务的效率,可能导致大型语言模型的推理速度更快和成本降低。
排序理由 这是一篇详细介绍优化AI模型服务新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →