一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。 AI
影响 这项研究通过阐明混合架构中的学习率迁移,有望提高大型语言模型的训练效率和可扩展性。
排序理由 该集群包含一篇详细介绍模型架构和训练方法新研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AdamW
- Language Models
- Mamba
- $\mu$P
- nemotron-h
- State Space Model
- State space models: Univariate representation of a multivariate model, partial interpolation and periodic convergence
- transformer
- Zero-order hold
- Zohra
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →