实体
Adafactor
Adafactor
PulseAugur coverage of Adafactor — every cluster mentioning Adafactor across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的SkewAdam优化器将MoE训练内存减少了97%
研究人员开发了SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合(MoE)模型训练期间的内存使用量。通过为MoE的不同参数群体(骨干网络、专家和路由器)分配不同级别的优化器状态精度,SkewAdam将内存需求从50.6 GB大幅削减至1.29 GB。这种优化使得在标准的40 GB加速器上训练大型MoE模型成为可能,而不会损害准确性,SkewAdam在验证困惑度方面优于AdamW、Muon和Lion,证明了这一点。
-
新的 Rose 优化器提供低显存、快速收敛和优异结果
一款名为 Rose 的新 PyTorch 优化器已根据 Apache 2.0 许可发布。Rose 由 Matthew K. 开发,设计为无状态,与 AdamW 等优化器相比,显存占用显著降低,内存开销与普通 SGD 相当。早期基准测试表明,它能实现快速收敛和出色的泛化能力,在某些任务上甚至优于 AdamW,并在 OpenAI 的参数-高尔夫挑战赛中展现出竞争力。