研究人员开发了 SMELT,一种用于混合专家(MoE)Transformer 的新架构,可提高训练效率和下游性能。通过将 Transformer 的中间层循环两次,同时仔细匹配计算预算,SMELT 与基线模型相比,展示了更快的损失减少和显著的训练 FLOPs 节省。这种架构改进转化为在各种基准测试中更好的性能,尤其是在代码相关任务中,这归因于一种将注意力重定向到更相关标记的机制。 AI
影响 这项研究为提高 Transformer 的效率和性能提供了一个实用的方法,可能影响未来的模型开发和训练策略。
排序理由 该集群描述了一篇详细介绍 Transformer 新架构的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Chinchilla
- Hugging Face
- Looped Transformers
- Mixture-of-Experts Transformers
- SMELT
- Baseline
- code
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →