实体
SkewAdam
SkewAdam
PulseAugur coverage of SkewAdam — every cluster mentioning SkewAdam across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
时间线
- 2026-07-22 research_milestone A new optimizer, SkewAdam, was published, significantly reducing memory requirements for MoE model training. 来源
最近 · 第 1/1 页 · 共 2 条
-
SkewAdam 优化器将 MoE 训练内存减少 97%
一种名为 SkewAdam 的新优化器已被开发出来,可显著减少训练混合专家(MoE)模型所需的内存。该优化器通过采用分层分配策略,以不同精度级别处理骨干参数、专家参数和路由器参数,实现了 97.4% 的优化器状态内存缩减。这种优化使得一个拥有 67.8 亿参数的 MoE 模型能够运行在单个 40GB GPU 上,而不会影响收敛性或稳定性。
-
新的SkewAdam优化器将MoE训练内存减少了97%
研究人员开发了SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合(MoE)模型训练期间的内存使用量。通过为MoE的不同参数群体(骨干网络、专家和路由器)分配不同级别的优化器状态精度,SkewAdam将内存需求从50.6 GB大幅削减至1.29 GB。这种优化使得在标准的40 GB加速器上训练大型MoE模型成为可能,而不会损害准确性,SkewAdam在验证困惑度方面优于AdamW、Muon和Lion,证明了这一点。