研究人员开发了MASKerade,一种将密集AI模型转换为稀疏混合专家(MoE)模型的新颖方法。该技术涉及将专家学习为冻结的前馈网络的子网络,并由学习到的二元掩码和令牌级路由器指导。这种方法允许灵活的专家结构,并在使用Qwen和Gemma骨干网络时,在视觉-语言基准测试上取得了卓越的性能,优于现有的密集到MoE升级方法。 AI
影响 该方法提供了一种从现有密集架构高效构建MoE模型的新方法,有望提高性能并降低计算成本。
排序理由 该集群描述了arXiv论文中提出的一种新颖方法,用于将密集AI模型转换为稀疏混合专家模型。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →