PulseAugur
实时 09:07:55
English(EN) UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo框架通过专家合并加速大型推荐模型

研究人员开发了UniMoMo,一个旨在加速使用稀疏混合专家(MoE)层的推荐模型的框架。这种训练后压缩方法将一个完整的MoE检查点转换为一个更小的、具有减少专家预算的标准MoE,而无需额外的在线压缩模块。UniMoMo根据功能相似性对专家进行分组,使用无标签的校准集来衡量它们对推荐状态的响应,并结合了一个层自适应保护机制来保护高流量专家。在Amazon Beauty、KuaiRec和TenRec数据集上的实验表明,具有四个专家的检查点实现了高NDCG@10比率(99.92%-102.30%)和显著的加速(1.28倍-1.63倍),即使是更激进的双专家配置也显示出相当或更好的性能。 AI

影响 这项研究可能导致更有效地部署大型推荐模型,降低计算成本并提高推理速度。

排序理由 该集群包含一篇详细介绍新模型加速框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

UniMoMo框架通过专家合并加速大型推荐模型

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong ·

    UniMoMo:基于专家融合的大规模推荐模型MoE加速

    arXiv:2608.08627v1 Announce Type: new Abstract: Sparse mixture-of-experts (MoE) layers expand recommendation capacity through conditional computation, yet a trained checkpoint still stores and routes over its full expert bank. We study a deployment problem: convert that checkpoin…