一种名为 SkewAdam 的新优化器已被开发出来,可显著减少训练混合专家(MoE)模型所需的内存。该优化器通过采用分层分配策略,以不同精度级别处理骨干参数、专家参数和路由器参数,实现了 97.4% 的优化器状态内存缩减。这种优化使得一个拥有 67.8 亿参数的 MoE 模型能够运行在单个 40GB GPU 上,而不会影响收敛性或稳定性。 AI
影响 使得在更易获得的硬件上训练更大的 MoE 模型成为可能,可能加速该领域的研发。
排序理由 该条目描述了一个在预印本上发布的新优化器,详细介绍了其技术方法和性能改进。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →