Hessian
PulseAugur coverage of Hessian — every cluster mentioning Hessian across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新算法使用一阶梯度简化联邦双层优化
研究人员开发了一种新的联邦随机双层优化算法,该算法避免了计算成本高昂的二阶Hessian和Jacobian矩阵。这种新颖的方法,称为联邦随机方差缩减双层梯度下降,完全依赖于一阶预言机,显著缩短了运行时间。该算法还采用了一种独特的常数单时间尺度学习率机制进行变量更新,并包含了一种建立收敛速率的新策略。实验结果据称已证实了该算法的有效性。
-
新研究探索联想记忆体“稳定边缘”的几何优化
研究人员探索了高容量核逻辑回归(KLR)联想记忆体的几何特性,识别出一种被称为“优化之脊”的关键超参数区域。该区域以主曲率被放大的几何奇点为特征,紧邻秩-1谱坍塌。研究表明,受“稳定边缘”现象影响的梯度下降优化将网络参数推向这个高度弯曲的边界,从而实现最优记忆表征的形成。
-
新的牛顿法达到 O(1/k^3) 收敛速率
研究人员开发了一种新颖的直接加速牛顿方法,用于最小化具有 Lipschitz 连续 Hessian 的凸函数。这种新算法仅使用原始变量进行操作,并且每次迭代仅需要一次线性求解,在函数残差方面实现了 O(1/k^3) 的全局收敛速率。该方法值得注意的是,它在不依赖辅助子问题或对偶修正的情况下达到了这一速率,并且可以在保持其快速全局收敛速率的同时以无 Hessian 的方式实现。该构造进一步扩展到通过 Bregman 散度和复合优化问题来…
-
新的“Rényi Sharpness”度量显示出与泛化能力的强相关性
研究人员引入了“Rényi sharpness”,这是一种用于评估神经网络泛化能力的新度量,旨在改进现有方法。与关注平均损失或Hessian矩阵最大特征值的传统锐度度量不同,Rényi sharpness利用Rényi熵来捕捉Hessian谱的平均扩散。这种新颖的方法在实验评估的各种场景中,均显示出与泛化能力之间存在强大且一致的相关性。此外,该论文还建立了与Rényi sharpness相关的泛化界限,并提出了一种名为Rényi Sh…
-
新理论重塑深度学习中的优化器稳定性
研究人员在深度学习中发现了一种现象,即基于梯度的优化器在理论预测的不稳定阈值之上保持稳定的Hessian特征值。这种偏差,观察到高达预测边界的21.1倍,是系统性的,并且取决于所使用的特定优化器。该研究提出了一种基于方向Hessian和梯度对齐得分的稳定性阈值的新表述,该表述考虑了优化器的实际更新,并提供了新的诊断工具来理解其在优化过程中平衡时间和空间预算中的作用。
-
新的理论界限改进了复杂分布的Langevin采样
研究人员为Moreau--Yosida未调整Langevin算法(MYULA)开发了新的理论界限,这是一种用于从复杂概率分布采样的算法。该研究侧重于非光滑复合目标,并引入了一个新指标——活动迹(active trace),与以前的方法相比,该指标能更好地控制算法的离散化误差。这一进展可能导致更有效的机器学习采样技术,特别是在涉及强凸和Lipschitz梯度的问��中。
-
新理论解释概率电路中的曲率
研究人员开发了一种组合理论来理解概率电路(PCs)中的曲率,PCs是一类生成模型。他们证明了Hessian迹(一种损失曲面曲率的度量)可以分解为节点的电路流和局部锐度项。这一见解有助于解释为什么全局锐度正则化会导致欠拟合和深度偏差。新理论支持一种自适应正则化器,该正则化器针对局部曲率,在保持锐度感知学习和闭式EM更新的好处的同时,保持了泛化能力。
-
广义二次梯度框架统一优化方法
研究人员引入了广义二次梯度(GQG),一个统一和扩展现有二阶优化方法的新型优化框架。GQG抽象了二次梯度(QG)和简化二次梯度(SQG)的核心原理,证明了满足局部二次模型平稳条件的正定曲率矩阵足以进行构建。这种泛化允许开发超越传统Hessian近似的新型感知曲率的优化算法,在深度学习中具有潜在应用。
-
新研究将 mini-batch 噪声与 SGD 中的损失景观尖锐度联系起来
一篇新的研究论文提出,在随机梯度下降(SGD)训练过程中,mini-batch 噪声通过引起主子空间内的波动来影响损失景观的尖锐度。作者认为,这个主子空间通常由 Hessian 的顶级特征向量定义,对于理解尖锐度动态比直接降低损失更重要。他们的工作推导出了与这些主方向上的 mini-batch 噪声相关的尖锐度校正项,实验表明,将此项纳入梯度下降的尖锐度演变使其更接近 SGD 的演变。
-
新的动力学理论正式化了零阶牛顿方法
研究人员为零阶牛顿型方法开发了正式的动力学理论,这在梯度和Hessian不可用时很有用。该框架包括一个高斯-斯坦(Gaussian-Stein)校正,用于准确估计平滑目标函数的Hessian。分析揭示了影响更新的两个噪声通道:一个来自梯度噪声,另一个来自Hessian噪声,在有噪声的Oracle条件下,后者携带一个重要的因子。动力学提升将有限步牛顿更新与欠阻尼相空间模型联系起来,产生了一个Lyapunov界限,突出了曲率与方差在步长、…
-
二次模型在LLM优化动态预测方面展现出预测能力
一篇新发表在arXiv上的论文提出,简单的二次模型可以出人意料地准确预测大型语言模型(LLM)的优化动态。研究人员通过分析这些模型的Hessian谱和局部稳定性,证明了他们可以在训练过程的很大一部分中预测优化行为。研究发现,LLM优化通常发生在随机稳定性边缘,并受批量大小和预处理程序等因素的影响。
-
新的 C-PTQ 方法提高了多模态大语言模型的量化效率
研究人员开发了 C-PTQ,一种新颖的训练后量化方法,旨在提高多模态大语言模型(MLLMs)的效率。该技术解决了由对量化高度敏感的异常通道引起的性能下降问题。C-PTQ 利用 Fisher 加权目标,近似二阶导数,以更好地捕捉量化对特定任务损失的影响。在 Qwen2.5VL、InternVL2 和 LLaVA-OV 等模型以及多个基准测试上的实验表明,C-PTQ 在仅权重量化和权重-激活量化场景中都有效。
-
神经网络研究揭示函数等价性与几何多样性
一篇新的研究论文在通用逼近定理的基础上,探讨了神经网络中的函数等价性概念。研究表明,多种神经网络配置可以实现相同的函数输出,同时拥有不同的几何特性。这种几何多样性通过分析成本函数的Hessian矩阵和参数空间的有效秩来表征,表明许多函数等价的网络存在显著的结构冗余和低有效秩。研究人员提出了一种基于简约性和估计效率的模型选择标准,以识别最优模型。
-
新的高斯不变MCMC方法提高了统计效率
研究人员开发了新颖的采样方法,包括随机游走Metropolis (RWM)、Metropolis调整的Langevin算法 (MALA) 以及二阶Hessian或流形MALA的高斯不变版本。这些方法通过利用高斯不变性来推导泊松方程的精确解析解,与标准的RWM和MALA相比,具有更高的统计效率。这使得能够构建有效的控制变量,用于估计量中的方差缩减,尤其在高维潜在高斯模型中得到了证明,并在这些模型中取得了最先进的结果。
-
神经网络海森特征值由近似对称性解释
研究人员为神经网络中海森矩阵的众多近零特征值提出了一种新的解释。他们认为,这些消失的特征值源于网络参数化中的近似对称性,他们称之为弱提升伪戈德斯通模式。在深度线性网络中,这些对称性是精确的,导致了平坦方向和零模式。引入像ReLU这样的整流非线性会扰乱这些对称性,导致它们弱化。该研究在各种网络架构中展示了这种机制,包括一个两层学生-教师模型和一个在CIFAR-10上训练的网络,表明这些发现不仅限于全连接层,还扩展到卷积网络。
-
梯度下降理论扩展至复杂最小值和向量输出
本文将大步长梯度下降(GD)的理论扩展到更复杂的场景。它解决了具有向量值输出的过参数化最小二乘问题,并分析了平坦最小值流形的邻域,这对矩阵分解等应用至关重要。该研究推广了现有的范式和收敛定理,并引入了一种求解奇异偏微分方程的新方法。
-
新研究详细介绍了深度学习中零阶优化的稳定性
一篇新的研究论文探讨了零阶(ZO)优化方法的稳定性动态,特别是在深度学习的背景下。该研究确定了一个控制这些方法线性稳定性的特定步长条件,并将其与一阶(FO)方法进行了对比。与受最大Hessian特征值影响的FO方法不同,ZO方法的稳定性取决于整个Hessian谱。研究还提出了基于最大特征值和Hessian迹的可行稳定性界限,发现全批量ZO方法在深度学习任务中运行在稳定性的边缘。
-
遗传算法在高维人工智能搜索中模拟了裁剪梯度下降
研究人员已经证明,遗传算法可以在高维搜索空间中有效地充当一种裁剪梯度下降。这个过程涉及变异-选择机制,它们在不直接计算的情况下隐式地遵循损失函数的梯度。由于噪声,遗传算法比传统的梯度下降慢,但其性能取决于损失函数Hessian的有效秩,这可能远小于参数的总数,尤其是在神经网络损失景观中。这一特性可能解释了遗传算法在复杂、高维问题中的可扩展性。
-
新的 CWGD 方法改进了深度学习的优化噪声测量
研究人员开发了一种名为曲率加权梯度多样性 (CWGD) 的新方法,以更好地测量深度学习模型中的优化噪声。与传统上同等对待所有参数方向的方法不同,CWGD 考虑了高曲率方向的噪声影响较小的这一事实。通过用 Hessian 的平方根的倒数来加权梯度多样性,CWGD 为有效的优化噪声提供了更准确的代理。与标准的余弦退火相比,CWGD 调制的余弦学习率计划 CWGD-Cosine 已显示出将最终优化误差降低高达 20% 的潜力,而开销可忽略不计。
-
Hessian 特征向量动力学揭示神经网络训练中优化器的差异
研究人员分析了神经网络训练过程中 Hessian 特征向量的演变,揭示了不同优化器之间存在的独特行为。研究发现,SGD 倾向于随着时间的推移稳定主要的曲率方向,而 Adam 则表现出这些特征向量的显著重组。此外,Adam 还表现出一种局部化现象,即一小组参数不成比例地影响主要曲率。