PulseAugur
实时 11:01:18
English(EN) Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

LLM服务调度器扩展以支持多层SLA

研究人员扩展了Llumnix LLM服务调度器,使其支持两个以上的优先级层,从而能够更好地管理异构的服务等级目标(SLO)。通过Vidur模拟器对增强型调度器进行了评估,结果表明在多个优先级层面上,成本效益和延迟降低方面都有显著提高。实验表明,四个优先级层提供了最佳的权衡,与INFaaS、vLLM、Orca和Sarathi-Serve等基线系统相比,实现了显著的加速和每延迟成本的改进。 AI

影响 提高了LLM服务的效率和成本效益,可能改善了多样化应用的最终用户体验。

排序理由 学术论文,详细介绍了对LLM服务调度器的扩展。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM服务调度器扩展以支持多层SLA

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Anders Vestrum, Arya Raeesi, Hanna Roed ·

    超越二元优先级:大型语言模型服务的多层SLA调度

    arXiv:2608.16336v1 Announce Type: cross Abstract: Modern LLM serving deployments must simultaneously satisfy heterogeneous service-level objectives (SLOs) across a diverse population of user tiers, ranging from latency-critical API calls to background batch processing. Llumnix in…