PulseAugur
实时 06:47:17
English(EN) Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

新的 SkewAdam 优化器大幅降低 MoE 训练内存使用量

研究人员开发了 SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合 (MoE) 语言模型训练期间的内存使用量。通过在模型的各个组件——骨干网络、专家和路由器——之间不同地分配优化器状态,SkewAdam 与 AdamW 等标准优化器相比,大大降低了内存需求。这种内存效率使得训练能够适应更小的加速器预算,而不会影响准确性,SkewAdam 在受控实验中实现了优于其他优化器的验证困惑度,证明了这一点。 AI

影响 通过减少内存开销,支持在现有硬件上训练更大的 MoE 模型。

排序理由 该集群包含一篇详细介绍用于训练大型语言模型的新优化技术的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 SkewAdam 优化器大幅降低 MoE 训练内存使用量

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Nuemaan Malik ·

    优化器状态应存放在何处?用于内存高效专家混合训练的分层状态分配

    arXiv:2607.19058v1 Announce Type: cross Abstract: Optimizer state is the largest single line item in the memory budget of mixture-of-experts (MoE) training: on a 6.78B-parameter MoE language model, AdamW keeps 50.6 GB of first and second moments to update 12.6 GB of bfloat16 weig…