PulseAugur
实时 10:39:32
实体 Nesterov momentum

Nesterov momentum

PulseAugur coverage of Nesterov momentum — every cluster mentioning Nesterov momentum across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_245541 ·

    新的 NoLoCo 方法大幅削减大语言模型训练通信成本

    研究人员开发了一种名为 NoLoCo 的新颖优化方法,旨在显著降低大语言模型训练期间的通信开销。与仍需要全局同步的现有低通信方法不同,NoLoCo 通过在随机选择的子组内部分平均模型权重来避免这种情况。与完全分片数据并行训练和 DiLoCo 等方法相比,这种方法导致通信强度较低。实证结果表明,NoLoCo 可以将最终困惑度提高高达 4%,并将实际运行时间收敛速度提高高达四倍。

  2. TOOL · CL_167128 ·

    新框架加速加权低秩矩阵逼近方法

    本文将加权低秩矩阵逼近(WLRMA)作为经典低秩逼近和矩阵填充的推广。它提出了一个统一的框架,用于开发高效的优化方法,包括基于Nesterov动量和Anderson加速的加速算法,用于秩约束和核范数WLRMA问题。该研究还提出了大规模稀疏数据矩阵的可扩展实现和有效的秩判据,展示了在矩阵填充和广义线性低秩建模方面的显著计算收益和应用。

  3. TOOL · CL_128782 ·

    模型合并技术在新的 IsoLoCo 方法中增强了分布式学习

    研究人员探索了使用模型合并技术来改进分布式学习方法(如 DiLoCo)中的聚合。通过将本地 SGD/DiLoCo 中的伪梯度聚合与基于任务算术的模型合并进行类比,他们确定 Iso-C 是一种有前景的方法。他们提出了 IsoLoCo,该方法通过 Nesterov 动量对 Iso-C 进行调整以进行分布式训练,与标准的 DiLoCo 相比,性能有了显著提高,尤其是在工作节点数量增加的情况下。

  4. RESEARCH · CL_97792 ·

    研究论文分析动量方法的计算效率和运行时间权衡

    一篇新研究论文探讨了重球法(HB)和加速SGD(ASGD)等随机动量方法的串行运行时间和计算效率之间的权衡。该研究证明了批量大小权衡的有限维下界,表明HB对于任意谱而言,在计算效率上并不比标准SGD有本质提升。相反,HB在更大的批量大小窗口内保持了SGD级别的效率,从而能够缩短串行运行时间。ASGD的性能取决于谱,对于快速衰减的谱,它提供了改进的小批量计算效率,但随着批量大小的增加,它会牺牲串行运行时间。

  5. RESEARCH · CL_25823 ·

    新的杆流模型跟踪Adam优化器在稳定性边缘

    研究人员开发了一种新的“杆流”模型,以更好地理解像Adam这样的自适应梯度优化方法在稳定性边缘的运行方式。该模型将之前关于梯度下降的工作扩展到包括基于动量的方法,将优化迭代视为一维“杆”。新框架准确地跟踪了包括Adam和RMSProp在内的八种不同优化器在各种机器学习架构上的离散迭代。

  6. RESEARCH · CL_05067 ·

    用于可解释、公平和可观察医院再入院预测的集成框架:在 MIMIC-IV 上的开发与验证

    研究人员开发了一种新的梯度正则化牛顿方案,以确保梯度提升决策树 (GBDT) 的全局收敛性,这是一种广泛用于表格机器学习的技术。该方法引入了一个自适应 L2 正则化项,实现了与 Nesterov 动量等一阶提升方法相当的收敛速度。数值实验表明,该新方案在标准牛顿提升可能发散的地方也能收敛。此外,另一项研究提出了一个用于从心电图中诊断射血分数的模态机器学习框架,实现了高精度并提供了可解释的特征。