研究人员开发了 SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合 (MoE) 语言模型训练期间的内存使用量。通过在模型的各个组件——骨干网络、专家和路由器——之间不同地分配优化器状态,SkewAdam 与 AdamW 等标准优化器相比,大大降低了内存需求。这种内存效率使得训练能够适应更小的加速器预算,而不会影响准确性,SkewAdam 在受控实验中实现了优于其他优化器的验证困惑度,证明了这一点。 AI
影响 通过减少内存开销,支持在现有硬件上训练更大的 MoE 模型。
排序理由 该集群包含一篇详细介绍用于训练大型语言模型的新优化技术的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →