研究人员开发了OrderMoE,一个用于在资源受限的边缘基础设施上部署混合专家(MoE)模型的新颖框架。OrderMoE通过根据功能相似性对专家进行分组来解决延迟和通信开销的挑战。该方法旨在通过在适当的时候使用本地替代专家来减少跨服务器令牌传输的需求。实验结果表明,OrderMoE显著降低了平均和尾部延迟,减少了跨服务器流量,并降低了远程专家调用率,同时推理质量仅有轻微、可控的下降。 AI
影响 这项研究可能能够更有效地在边缘设备上部署大型语言模型,提高性能并降低通信成本。
排序理由 该集群描述了一篇新研究论文,其中详细介绍了一个用于优化MoE模型推理的新颖框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →