实体
Warmup-stable-decay
Warmup-stable-decay
PulseAugur coverage of Warmup-stable-decay — every cluster mentioning Warmup-stable-decay across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
研究探讨动量在大型语言模型损失景观优化中的作用
一篇新的研究论文探讨了大型语言模型中损失景观的“河谷”结构,提出动量加速在优化这些复杂环境中起着至关重要的作用。研究表明,动量有助于稳定较大的学习率,从而在景观中的“河流”低损失流形上实现更快的进展。这种理论分析旨在解释某些学习率调度器(如Warmup-stable-decay)的有效性,这些调度器在衰减学习率之前保持较高的学习率,这与Cosine Scheduling等方法形成对比。
-
函数缩放定律下探索最优学习率调度
本文探讨了机器学习模型最优学习率调度,特别是在函数缩放定律(FSL)框架下。文章确定了一个基于任务难度和模型容量的关键过渡点,该点决定了早期幂衰减还是预热-稳定-衰减调度更有效。研究还表明,精确的衰减形状调整可能不如之前认为的那么关键,分数调度可以达到最优收敛率。
-
新的WSqD学习率调度器为大模型训练提供无视界训练
研究人员推出了一种新颖的学习率调度器WSqD,专为大模型训练设计,且不依赖于训练视界。与余弦退火和Warmup-stable-decay (WSD) 等现有方法不同,WSqD的基础调度器不需要预先确定的训练时长,从而可以灵活地延长训练。这种受随机凸优化启发的方法,理论上可以达到最优收敛率,并且在SlimPajama语料库的语言模型预训练任务上,实证表明其性能可与基线相媲美或超越。