研究人员开发了SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合(MoE)模型训练期间的内存使用量。通过为MoE的不同参数群体(骨干网络、专家和路由器)分配不同级别的优化器状态精度,SkewAdam将内存需求从50.6 GB大幅削减至1.29 GB。这种优化使得在标准的40 GB加速器上训练大型MoE模型成为可能,而不会损害准确性,SkewAdam在验证困惑度方面优于AdamW、Muon和Lion,证明了这一点。 AI
影响 使得在现有硬件上训练更大的MoE模型成为可能,可能加速研究和部署。
排序理由 该集群描述了一篇详细介绍用于训练大型AI模型的新颖优化技术的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →