PulseAugur
实时 08:59:05
English(EN) MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism框架通过弹性专家路由增强LLM服务

研究人员开发了MoE-Prism,一个旨在提高混合专家(MoE)模型在服务大型语言模型(LLM)方面的效率的框架。该系统通过将单体专家分解为更小的子专家,实现了请求级别的计算弹性,从而能够进行更灵活的路由配置。MoE-Prism已在vLLM之上实现,并在异构工作负载的离线推理吞吐量方面有所提高,并减少了首次响应时间。 AI

影响 这项研究通过实现基于请求复杂度的动态资源分配,有望提高大型语言模型服务的效率和成本效益。

排序理由 这是一篇详细介绍新MoE模型优化框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

MoE-Prism框架通过弹性专家路由增强LLM服务

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo ·

    MoE-Prism:通过模型-系统协同设计解耦单体专家以实现弹性MoE服务

    arXiv:2510.19366v2 Announce Type: replace Abstract: Mixture-of-Experts (MoE) scales model capacity through sparse activation, and is becoming an important architecture for large language models (LLMs). However, existing MoE serving systems typically execute all requests under a f…