PulseAugur
实时 15:01:33
English(EN) OrderMoE: An expert similarity driven distributed edge MoE inference

OrderMoE框架通过专家相似性优化边缘MoE模型推理

研究人员开发了OrderMoE,一个用于在资源受限的边缘基础设施上部署混合专家(MoE)模型的新颖框架。OrderMoE通过根据功能相似性对专家进行分组来解决延迟和通信开销的挑战。该方法旨在通过在适当的时候使用本地替代专家来减少跨服务器令牌传输的需求。实验结果表明,OrderMoE显著降低了平均和尾部延迟,减少了跨服务器流量,并降低了远程专家调用率,同时推理质量仅有轻微、可控的下降。 AI

影响 这项研究可能能够更有效地在边缘设备上部署大型语言模型,提高性能并降低通信成本。

排序理由 该集群描述了一篇新研究论文,其中详细介绍了一个用于优化MoE模型推理的新颖框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

OrderMoE框架通过专家相似性优化边缘MoE模型推理

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang ·

    OrderMoE:一种专家相似度驱动的分布式边缘MoE推理

    arXiv:2607.17154v1 Announce Type: cross Abstract: Although mixture-of-experts, MoE, models have been increasingly adopted to scale large language models with moderate computation cost, it remains challenging to deploy MoE inference over resource-constrained and bandwidth-limited …