研究人员推出了一种新颖的神经网络架构——混合复用专家(MoRE),它结合了循环Transformer的参数效率和混合专家(MoE)模型的能力。MoRE通过在相邻层之间共享专家池来解决传统MoE的高内存占用问题,从而在不增加参数的情况下实现更大的路由多样性。实验表明,在困惑度和下游任务方面,MoRE在各种模型规模上均优于现有的权重共享架构和标准MoE。 AI
影响 该架构可能带来更具参数效率的大型语言模型,从而降低训练和推理的内存需求。
排序理由 该集群包含一篇详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →