PulseAugur
中
实时 10:37:30
实体 gradient accumulation

gradient accumulation

PulseAugur coverage of gradient accumulation — every cluster mentioning gradient accumulation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_218455 ·

    TRL LoRA 中的梯度累积影响微调运行时

    本文探讨了梯度累积对使用 Transformer 强化学习 (TRL) 库中的 LoRA(低秩适配)微调大型语言模型运行时长所产生的影响。文章详细介绍了 TRL 的默认打包方法如何影响每次前向传播处理的序列,从而导致即使在相同的有效批次大小下运行时长也会有所不同。

  2. TOOL · CL_204326 ·

    新研究对内存高效的AI训练梯度优化器进行基准测试

    一项新研究针对四种Transformer架构,对五种梯度优化器(SGD、Adam、Adagrad、Adadelta和共轭梯度下降)与三种节省内存的策略(标准训练、梯度检查点和梯度累积)进行了基准测试。研究发现,梯度累积是在不增加GPU内存使用量的情况下降低训练损失最有效的策略。研究还显示,Adam并非总是最优的优化器,在某些架构中,Adadelta和SGD的表现优于它,而梯度检查点的有效性高度依赖于具体的模型架构。