研究人员开发了UniMoMo,一个旨在加速使用稀疏混合专家(MoE)层的推荐模型的框架。这种训练后压缩方法将一个完整的MoE检查点转换为一个更小的、具有减少专家预算的标准MoE,而无需额外的在线压缩模块。UniMoMo根据功能相似性对专家进行分组,使用无标签的校准集来衡量它们对推荐状态的响应,并结合了一个层自适应保护机制来保护高流量专家。在Amazon Beauty、KuaiRec和TenRec数据集上的实验表明,具有四个专家的检查点实现了高NDCG@10比率(99.92%-102.30%)和显著的加速(1.28倍-1.63倍),即使是更激进的双专家配置也显示出相当或更好的性能。 AI
影响 这项研究可能导致更有效地部署大型推荐模型,降低计算成本并提高推理速度。
排序理由 该集群包含一篇详细介绍新模型加速框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →