PulseAugur
实时 11:11:40
实体 Hessian

Hessian

PulseAugur coverage of Hessian — every cluster mentioning Hessian across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 18
层级分布 · 90 天
主题
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. RESEARCH · CL_180783 ·

    广义二次梯度框架统一优化方法

    研究人员引入了广义二次梯度(GQG),一个统一和扩展现有二阶优化方法的新型优化框架。GQG抽象了二次梯度(QG)和简化二次梯度(SQG)的核心原理,证明了满足局部二次模型平稳条件的正定曲率矩阵足以进行构建。这种泛化允许开发超越传统Hessian近似的新型感知曲率的优化算法,在深度学习中具有潜在应用。

  2. TOOL · CL_167607 ·

    新研究将 mini-batch 噪声与 SGD 中的损失景观尖锐度联系起来

    一篇新的研究论文提出,在随机梯度下降(SGD)训练过程中,mini-batch 噪声通过引起主子空间内的波动来影响损失景观的尖锐度。作者认为,这个主子空间通常由 Hessian 的顶级特征向量定义,对于理解尖锐度动态比直接降低损失更重要。他们的工作推导出了与这些主方向上的 mini-batch 噪声相关的尖锐度校正项,实验表明,将此项纳入梯度下降的尖锐度演变使其更接近 SGD 的演变。

  3. TOOL · CL_167288 ·

    新的动力学理论正式化了零阶牛顿方法

    研究人员为零阶牛顿型方法开发了正式的动力学理论,这在梯度和Hessian不可用时很有用。该框架包括一个高斯-斯坦(Gaussian-Stein)校正,用于准确估计平滑目标函数的Hessian。分析揭示了影响更新的两个噪声通道:一个来自梯度噪声,另一个来自Hessian噪声,在有噪声的Oracle条件下,后者携带一个重要的因子。动力学提升将有限步牛顿更新与欠阻尼相空间模型联系起来,产生了一个Lyapunov界限,突出了曲率与方差在步长、…

  4. TOOL · CL_164985 ·

    二次模型在LLM优化动态预测方面展现出预测能力

    一篇新发表在arXiv上的论文提出,简单的二次模型可以出人意料地准确预测大型语言模型(LLM)的优化动态。研究人员通过分析这些模型的Hessian谱和局部稳定性,证明了他们可以在训练过程的很大一部分中预测优化行为。研究发现,LLM优化通常发生在随机稳定性边缘,并受批量大小和预处理程序等因素的影响。

  5. TOOL · CL_160971 ·

    新的 C-PTQ 方法提高了多模态大语言模型的量化效率

    研究人员开发了 C-PTQ,一种新颖的训练后量化方法,旨在提高多模态大语言模型(MLLMs)的效率。该技术解决了由对量化高度敏感的异常通道引起的性能下降问题。C-PTQ 利用 Fisher 加权目标,近似二阶导数,以更好地捕捉量化对特定任务损失的影响。在 Qwen2.5VL、InternVL2 和 LLaVA-OV 等模型以及多个基准测试上的实验表明,C-PTQ 在仅权重量化和权重-激活量化场景中都有效。

  6. RESEARCH · CL_156366 ·

    神经网络研究揭示函数等价性与几何多样性

    一篇新的研究论文在通用逼近定理的基础上,探讨了神经网络中的函数等价性概念。研究表明,多种神经网络配置可以实现相同的函数输出,同时拥有不同的几何特性。这种几何多样性通过分析成本函数的Hessian矩阵和参数空间的有效秩来表征,表明许多函数等价的网络存在显著的结构冗余和低有效秩。研究人员提出了一种基于简约性和估计效率的模型选择标准,以识别最优模型。

  7. TOOL · CL_141220 ·

    新的高斯不变MCMC方法提高了统计效率

    研究人员开发了新颖的采样方法,包括随机游走Metropolis (RWM)、Metropolis调整的Langevin算法 (MALA) 以及二阶Hessian或流形MALA的高斯不变版本。这些方法通过利用高斯不变性来推导泊松方程的精确解析解,与标准的RWM和MALA相比,具有更高的统计效率。这使得能够构建有效的控制变量,用于估计量中的方差缩减,尤其在高维潜在高斯模型中得到了证明,并在这些模型中取得了最先进的结果。

  8. TOOL · CL_135386 ·

    神经网络海森特征值由近似对称性解释

    研究人员为神经网络中海森矩阵的众多近零特征值提出了一种新的解释。他们认为,这些消失的特征值源于网络参数化中的近似对称性,他们称之为弱提升伪戈德斯通模式。在深度线性网络中,这些对称性是精确的,导致了平坦方向和零模式。引入像ReLU这样的整流非线性会扰乱这些对称性,导致它们弱化。该研究在各种网络架构中展示了这种机制,包括一个两层学生-教师模型和一个在CIFAR-10上训练的网络,表明这些发现不仅限于全连接层,还扩展到卷积网络。

  9. RESEARCH · CL_135235 ·

    梯度下降理论扩展至复杂最小值和向量输出

    本文将大步长梯度下降(GD)的理论扩展到更复杂的场景。它解决了具有向量值输出的过参数化最小二乘问题,并分析了平坦最小值流形的邻域,这对矩阵分解等应用至关重要。该研究推广了现有的范式和收敛定理,并引入了一种求解奇异偏微分方程的新方法。

  10. TOOL · CL_121437 ·

    新研究详细介绍了深度学习中零阶优化的稳定性

    一篇新的研究论文探讨了零阶(ZO)优化方法的稳定性动态,特别是在深度学习的背景下。该研究确定了一个控制这些方法线性稳定性的特定步长条件,并将其与一阶(FO)方法进行了对比。与受最大Hessian特征值影响的FO方法不同,ZO方法的稳定性取决于整个Hessian谱。研究还提出了基于最大特征值和Hessian迹的可行稳定性界限,发现全批量ZO方法在深度学习任务中运行在稳定性的边缘。

  11. TOOL · CL_117145 ·

    遗传算法在高维人工智能搜索中模拟了裁剪梯度下降

    研究人员已经证明,遗传算法可以在高维搜索空间中有效地充当一种裁剪梯度下降。这个过程涉及变异-选择机制,它们在不直接计算的情况下隐式地遵循损失函数的梯度。由于噪声,遗传算法比传统的梯度下降慢,但其性能取决于损失函数Hessian的有效秩,这可能远小于参数的总数,尤其是在神经网络损失景观中。这一特性可能解释了遗传算法在复杂、高维问题中的可扩展性。

  12. RESEARCH · CL_117170 ·

    新的 CWGD 方法改进了深度学习的优化噪声测量

    研究人员开发了一种名为曲率加权梯度多样性 (CWGD) 的新方法,以更好地测量深度学习模型中的优化噪声。与传统上同等对待所有参数方向的方法不同,CWGD 考虑了高曲率方向的噪声影响较小的这一事实。通过用 Hessian 的平方根的倒数来加权梯度多样性,CWGD 为有效的优化噪声提供了更准确的代理。与标准的余弦退火相比,CWGD 调制的余弦学习率计划 CWGD-Cosine 已显示出将最终优化误差降低高达 20% 的潜力,而开销可忽略不计。

  13. RESEARCH · CL_117383 ·

    Hessian 特征向量动力学揭示神经网络训练中优化器的差异

    研究人员分析了神经网络训练过程中 Hessian 特征向量的演变,揭示了不同优化器之间存在的独特行为。研究发现,SGD 倾向于随着时间的推移稳定主要的曲率方向,而 Adam 则表现出这些特征向量的显著重组。此外,Adam 还表现出一种局部化现象,即一小组参数不成比例地影响主要曲率。

  14. RESEARCH · CL_115597 ·

    新方法为Bregman ADMM提供二阶KKT保证

    研究人员开发了一种新颖的方法来分析非凸和非Lipschitz优化问题的Bregman ADMM。该方法用双边相对平滑条件取代了标准的Lipschitz梯度假设,该条件涉及相对于Bregman核的Hessian比较。分析表明,在此条件下,迭代以高概率收敛到严格鞍点,从而导致极限KKT点的几乎确定性二阶平稳性。该工作通过多块星形共识公式扩展到分布式优化,并包括矩阵和张量分解的数值实验。

  15. RESEARCH · CL_93643 ·

    新的研究框架对稳定性边缘的梯度下降进行建模

    两篇新的研究论文探讨了深度学习中在稳定性边缘(EoS)运行的梯度下降现象。第一篇论文介绍了“Edge Flow”,这是一个微分方程系统,用于模拟EoS下的梯度下降动力学,将其分解为中心、振荡方向和幅度。第二篇论文提出了一个适用于过参数化神经网络的分岔理论框架,展示了稳定的EoS训练如何从翻转分岔产生,并在特定条件下证明了收敛到最小化流形。

  16. RESEARCH · CL_93696 ·

    新的“架构预热”稳定了Transformer训练

    研究人员开发了一种新方法来稳定大型Transformer模型的训练,这类模型通常容易出现不稳定性或发散。该方法称为“架构预热”,通过逐步增加网络深度来管理预条件Hessian,这是与训练不稳定性相关的曲率度量。该技术得到了一个用于Hessian特征值快速在线估计器的支持,已被证明可以在不影响收敛的情况下减少不稳定性。

  17. RESEARCH · CL_90893 ·

    新的优化技术出现,可实现更快、更高效的 AI 模型训练 · 跟踪 8 个来源

    几篇最新的 arXiv 论文探讨了机器学习优化技术的进展。研究人员提出了新的方法,如权重自适应 ASNG (WA-ASNG) 以提高进化算法的并行性能,以及通过子空间获取函数实现的可扩展批量贝叶斯优化,以提高大批量处理的效率。其他工作引入了 MGUP,一种用于随机优化的动量梯度对齐更新策略,以及 OptEMA,一种用于无噪声最优化的自适应指数移动平均。此外,Gefen 等新的优化器旨在减少内存占用同时保持性能,理论分析也为随机梯度下降…

  18. RESEARCH · CL_08352 ·

    新研究探讨了网络对称性如何帮助优化过参数化的深度学习模型。

    一篇新论文分析了神经网络中的过参数化如何通过引入额外的对称性来帮助优化。这些对称性充当了Hessian的预条件形式,从而导致更好的条件最小化。此外,过参数化增加了找到接近典型初始化的全局最小值的可能性,使其更容易获得。通过师生网络进行的实验证实了这些理论预测,显示随着网络宽度的增加,收敛性和条件数都有所改善。