PulseAugur
实时 08:36:54
实体 Shampoo

Shampoo

PulseAugur coverage of Shampoo — every cluster mentioning Shampoo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_185433 ·

    Adam优化器在因子模型中与梯度下降不同

    一篇新的研究论文探讨了Adam和梯度下降等优化算法在应用于因子模型时行为的差异。研究表明,虽然梯度下降由于损失函数的规范对称性而隐式地偏向于低秩解,但Adam和类似的逐坐标优化器不具备这种偏向。这种差异归因于规范等变性,它对于从梯度流转移性质是必需的,但不足以恢复低秩。该研究根据恢复误差对九种更新规则进行了排序,发现Adam在Transformer中分离了规范等价的初始化,导致每个头的逆变器存在显著差异。

  2. RESEARCH · CL_194852 ·

    Adam优化器打破了因子模型中的低秩偏差,而梯度下降则不会

    一篇新论文揭示,虽然梯度下降由于规范等变性而隐式地偏好因子矩阵模型中的低秩解,但流行的Adam优化器却不会。这种差异归因于Adam的每坐标二阶矩计算,它打破了梯度下降所遵循的对称性。实验表明,像Adam和RMSProp这样的优化器会丢失这种低秩偏差,导致在矩阵感知和Transformer等任务上的性能不如梯度下降和其他等变优化器。研究表明,各向异性而不是自适应性是影响这种偏差的关键因素。

  3. RESEARCH · CL_154026 ·

    新的机器学习优化技术解决了非凸问题和偏微分方程求解器

    研究人员开发了优化机器学习算法的新方法,特别是在非凸优化和科学计算的背景下。一篇论文介绍了一种黑盒在线到非凸转换技术,该技术利用静态遗憾最小化预言机,解决了开放性问题,并为 AdaGrad 和 Shampoo 等自适应优化方法提供了新视角。另一项研究提出了 PCGBandit,一种用于瞬态偏微分方程求解器的一步加速方法,该方法使用 bandit 算法直接从模拟数据中自适应地学习求解器配置,并在使用 OpenFOAM 的流体和磁流体动力…

  4. TOOL · CL_111777 ·

    DASH 优化器通过 GPU 和求根创新将 Shampoo 加速高达 5.6 倍

    研究人员开发了 DASH,这是 Shampoo 优化器的一个显著更快的实现,用于机器学习。DASH 利用批处理块预处理来提高 GPU 利用率,并引入了牛顿-DB 和切比雪夫多项式近似等新方法来计算逆矩阵根。与现有的分布式 Shampoo 实现相比,这种优化使优化器步长速度提高了 5.6 倍,同时在每次迭代中也实现了更低的验证困惑度。

  5. TOOL · CL_86796 ·

    LoRA-Muon:新型优化器提升深度学习微调效率

    研究人员推出了一种名为LoRA-Muon的优化技术,旨在提高低秩适配(LoRA)在深度学习模型中的效率和有效性。该新方法将谱最速下降规则应用于低秩设置,旨在为现有的LoRA微调方法提供更稳定、性能更好的替代方案。LoRA-Muon在跨越不同模型维度时表现出更强的学习率可迁移性,甚至在某些场景下可以超越密集基线,提供一种更节省内存的方法。

  6. RESEARCH · CL_65622 ·

    新的FOAM算法提高了Shampoo的优化效率

    研究人员推出了一种新的自适应算法FOAM,旨在提高Shampoo优化方法的效率。Shampoo在大规模基准测试中表现强劲,但由于矩阵求逆导致计算成本高昂。FOAM通过理论分析在使用过时的预条件更新时计算效率和优化保真度之间的权衡来解决这个问题。该算法动态调整阻尼因子和特征分解频率,以稳定训练并减少陈旧性误差。

  7. RESEARCH · CL_65240 ·

    新方法利用权重空间对称性近似损失曲率

    研究人员开发了一种新颖的方法,通过利用权重空间对称性来近似大型深度学习模型中损失函数的曲率。该方法对保持损失不变的群作用进行解析平均,从而能够从单个梯度构建结构化的Hessian近似。该框架允许用户通过选择特定的对称群来控制准确性-成本权衡,并统一了现有的方法,如Shampoo/Muon。该技术已在各种架构上得到验证,并应用于二阶优化基准测试,包括一个小型语言模型,在不确定性估计和持续学习等领域具有潜在应用。

  8. TOOL · CL_53856 ·

    新方法提高了神经网络训练算法的效率

    研究人员开发了一种新方法来重新参数化 Shampoo 和 SOAP 算法,提高了它们训练神经网络的效率。该技术支持 BFloat16 存储,从而减少内存使用量,并缓解了与此存储格式相关的性能下降。通过仅更新基向量的子空间,该方法显著降低了计算开销,使得基于 Shampoo 的方法在时间和内存方面更有效率,尤其适用于大型预处理矩阵。

  9. TOOL · CL_27734 ·

    研究发现Muon优化器在凸Lipschitz函数上失效

    一篇新论文挑战了Muon优化算法的理论基础,证明它在凸Lipschitz函数上不收敛。研究表明,Muon的实际成功可能源于这种经典模型未能捕捉到的平滑特性。虽然误差反馈可以恢复理论收敛性,但它会降低在关键深度学习任务中的实际性能。

  10. TOOL · CL_20404 ·

    Layerwise LQR 框架使用几何感知控制优化深度网络

    研究人员开发了 Layerwise LQR (LLQR),一个用于深度学习模型的新优化框架。LLQR 将二阶优化方法(如牛顿法)重新表述为线性二次调节器问题。这种方法可以学习结构化的逆预处理器,在不计算完整曲率矩阵的情况下捕获全局层级动态。在 ResNets 和 Transformers 上的实验表明,LLQR 可以在计算开销极小的情况下提高优化速度和最终模型性能。

  11. RESEARCH · CL_14458 ·

    新理论统一了非凸机器学习的自适应优化方法

    研究人员开发了一个统一的框架来分析非凸机器学习中使用的一阶优化算法。该框架涵盖了AdaGrad、AdaNorm以及Shampoo和Muo的变体等流行方法。该分析为这些方法提供了随机收敛率,即使在有动量且不对梯度有界或步长较小的情况下也是如此。