实体
Llama 3.1 1B
Llama 3.1 1B
PulseAugur coverage of Llama 3.1 1B — every cluster mentioning Llama 3.1 1B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI训练效率:梯度优化方法基准测试
一篇新的研究论文在受限硬件上对五种梯度优化器和三种内存策略进行了AI训练基准测试。研究发现,梯度累积是在不同架构上降低训练损失最有效的策略,而梯度检查点的性能高度依赖于架构。与普遍假设相反,Adam并非普遍优越,在某些情况下Adadelta和SGD的表现优于它。该研究为选择优化器和梯度策略以提高AI模型训练和部署的资源效率提供了实用指导。
-
新研究对内存高效的AI训练梯度优化器进行基准测试
一项新研究针对四种Transformer架构,对五种梯度优化器(SGD、Adam、Adagrad、Adadelta和共轭梯度下降)与三种节省内存的策略(标准训练、梯度检查点和梯度累积)进行了基准测试。研究发现,梯度累积是在不增加GPU内存使用量的情况下降低训练损失最有效的策略。研究还显示,Adam并非总是最优的优化器,在某些架构中,Adadelta和SGD的表现优于它,而梯度检查点的有效性高度依赖于具体的模型架构。