PulseAugur
中
实时 03:59:26
实体 Warmup-stable-decay

Warmup-stable-decay

PulseAugur coverage of Warmup-stable-decay — every cluster mentioning Warmup-stable-decay across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_268923 ·

    研究探讨动量在大型语言模型损失景观优化中的作用

    一篇新的研究论文探讨了大型语言模型中损失景观的“河谷”结构,提出动量加速在优化这些复杂环境中起着至关重要的作用。研究表明,动量有助于稳定较大的学习率,从而在景观中的“河流”低损失流形上实现更快的进展。这种理论分析旨在解释某些学习率调度器(如Warmup-stable-decay)的有效性,这些调度器在衰减学习率之前保持较高的学习率,这与Cosine Scheduling等方法形成对比。

  2. TOOL · CL_254837 ·

    函数缩放定律下探索最优学习率调度

    本文探讨了机器学习模型最优学习率调度,特别是在函数缩放定律(FSL)框架下。文章确定了一个基于任务难度和模型容量的关键过渡点,该点决定了早期幂衰减还是预热-稳定-衰减调度更有效。研究还表明,精确的衰减形状调整可能不如之前认为的那么关键,分数调度可以达到最优收敛率。

  3. RESEARCH · CL_141050 ·

    新的WSqD学习率调度器为大模型训练提供无视界训练

    研究人员推出了一种新颖的学习率调度器WSqD,专为大模型训练设计,且不依赖于训练视界。与余弦退火和Warmup-stable-decay (WSD) 等现有方法不同,WSqD的基础调度器不需要预先确定的训练时长,从而可以灵活地延长训练。这种受随机凸优化启发的方​​法,理论上可以达到最优收敛率,并且在SlimPajama语料库的语言模型预训练任务上,实证表明其性能可与基线相媲美或超越。