两篇新研究论文探讨了对混合专家(MoE)大型语言模型的增强。第一篇论文引入了令牌错误监督来指导MoE路由,通过将路由亲和力与实际令牌错误对齐,提高了在Granite和ARC-Challenge等基准测试上的准确性。第二篇论文提出了用于非因子化扩散语言模型的增强混合专家(E-MoE),使用MoE路由在离散潜在空间中捕获跨位置相关性,而无需增加活动参数,从而提高了少步生成质量。 AI
影响 这些论文引入了用于提高混合专家模型效率和性能的新颖技术,有望带来更强大、更快速的LLM。
排序理由 两篇发表在arXiv上的学术论文,详细介绍了混合专家大型语言模型的新颖方法。
- ARC challenge
- arXiv
- cross entropy
- Granite
- Hugging Face
- Itakura--Saito divergence
- large-language models
- LM1B
- Masked Diffusion Models
- mixture of experts
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →