实体
Adafactor
Adafactor
PulseAugur coverage of Adafactor — every cluster mentioning Adafactor across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的自适应对数空间量化提高了LLM优化器的内存效率
研究人员开发了一种名为自适应对数空间(AL)的新量化方法,以提高训练大型语言模型时使用的优化器的内存效率。该方法为每个块自适应量化范围,并保持精确零不变性,与现有的低精度技术相比,提供了更好的状态重构误差控制。在TinyLlama-1.1B和GPT-2等模型上的评估表明,在对困惑度或损失影响极小的情况下,优化器状态存储显著减少,这表明了一种更具拓扑感知的优化器量化方法。
-
新的SkewAdam优化器将MoE训练内存减少了97%
研究人员开发了SkewAdam,这是一种新颖的优化器,旨在显著减少专家混合(MoE)模型训练期间的内存使用量。通过为MoE的不同参数群体(骨干网络、专家和路由器)分配不同级别的优化器状态精度,SkewAdam将内存需求从50.6 GB大幅削减至1.29 GB。这种优化使得在标准的40 GB加速器上训练大型MoE模型成为可能,而不会损害准确性,SkewAdam在验证困惑度方面优于AdamW、Muon和Lion,证明了这一点。
-
新的 Rose 优化器提供低显存、快速收敛和优异结果
一款名为 Rose 的新 PyTorch 优化器已根据 Apache 2.0 许可发布。Rose 由 Matthew K. 开发,设计为无状态,与 AdamW 等优化器相比,显存占用显著降低,内存开销与普通 SGD 相当。早期基准测试表明,它能实现快速收敛和出色的泛化能力,在某些任务上甚至优于 AdamW,并在 OpenAI 的参数-高尔夫挑战赛中展现出竞争力。