研究人员开发了UniMoMo,一个训练后压缩框架,旨在加速使用混合专家(MoE)层的推荐模型。该方法根据专家的功能相似性而非参数距离对专家进行分组,并使用无标签的校准数据来评估专家对推荐状态的响应相似度。UniMoMo还引入了一个层自适应保护机制,通过限制高流量专家的合并来防止性能下降。在Amazon Beauty、KuaiRec和TenRec等数据集上的实验表明,将MoE模型压缩到更少的专家数量可以显著提高推理速度,同时保持高质量的推荐效果。 AI
影响 这项研究提供了一种降低大型推荐模型计算成本的实用方法,有望实现更广泛的部署和更快的用户体验。
排序理由 该集群描述了一篇详细介绍新颖模型压缩框架的新研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →