PulseAugur
实时 09:14:11
English(EN) Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

新的SkewAdam优化器将MoE训练内存减少了97%

研究人员开发了SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合(MoE)模型训练期间的内存使用量。通过为MoE的不同参数群体(骨干网络、专家和路由器)分配不同级别的优化器状态精度,SkewAdam将内存需求从50.6 GB大幅削减至1.29 GB。这种优化使得在标准的40 GB加速器上训练大型MoE模型成为可能,而不会损害准确性,SkewAdam在验证困惑度方面优于AdamW、Muon和Lion,证明了这一点。 AI

影响 使得在现有硬件上训练更大的MoE模型成为可能,可能加速研究和部署。

排序理由 该集群描述了一篇详细介绍用于训练大型AI模型的新颖优化技术的研究论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的SkewAdam优化器将MoE训练内存减少了97%

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Nuemaan Malik ·

    优化器状态应存放在何处?用于内存高效专家混合训练的分层状态分配

    arXiv:2607.19058v1 Announce Type: cross Abstract: Optimizer state is the largest single line item in the memory budget of mixture-of-experts (MoE) training: on a 6.78B-parameter MoE language model, AdamW keeps 50.6 GB of first and second moments to update 12.6 GB of bfloat16 weig…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    优化器状态应存放在何处?用于内存高效专家混合训练的分层状态分配

    Optimizer state is the largest single line item in the memory budget of mixture-of-experts (MoE) training: on a 6.78B-parameter MoE language model, AdamW keeps 50.6 GB of first and second moments to update 12.6 GB of bfloat16 weights. We study SkewAdam, an optimizer built on the …