gradient descent
PulseAugur coverage of gradient descent — every cluster mentioning gradient descent across labs, papers, and developer communities, ranked by signal.
- instance of stochastic gradient descent 90%
- used by Deep Neural Networks 90%
- used by deep learning 90%
- used by logistic regression model 90%
- used by rectifier 90%
- used by artificial neural network 80%
- affiliated with stochastic gradient descent 70%
- instance of Influence Flower 70%
- competes with stochastic gradient descent 70%
- used by Hessian 70%
- used by Gotit.pub 70%
- instance of Deep Neural Networks 70%
13 天有情绪数据
-
研究发现,仅靠平坦度不足以实现神经网络的 grokking
研究人员调查了损失景观平坦度在神经网络泛化中的作用,特别是在 grokking 现象中。虽然之前的工作表明平坦度是泛化所必需的,但本研究发现,仅使用 Sharpness Aware Minimization (SAM)(它倾向于将训练导向更平坦的解)不足以可靠地诱导 grokking。然而,当 SAM 与权重衰减结合使用时,它能将泛化解的过渡速度在 epoch 层面提高多达四倍。对最小的两层 ReLU 模型的理论分析表明,仅靠平坦度无…
-
研究:信息移除不足以保证开放权重模型的抗篡改性
一篇新发表在arXiv上的研究论文质疑了移除信息内容作为认证开放权重模型抗篡改性方法的有效性。研究表明,互信息本身不足以进行通用认证,因为保持函数不变的重参数化可以在不改变信息内容的情况下改变梯度下降的几何形状。研究强调,训练顺序会影响恢复时间,并且表示层级的独立性可以保留参数雅可比矩阵。一个明确的构造表明,零信息量仍然会导致快速恢复,这表明认证需要对攻击动态施加比初始互信息更严格的约束。
-
新方法学习 Softmax 注意力模型中的决策阈值
研究人员开发了一种在双参数 Softmax 注意力模型中学习决策桩阈值的方法。该方法使用基于梯度的预训练,在带标签的上下文及其真实阈值上进行,以仅从上下文推断新阈值。研究详细说明了在具有固定示例的多个任务上进行梯度下降如何导致一个具有特定错误率的冻结估计器,将有限预训练精度与新鲜上下文定位分离开来。该机制涉及协调的参数发散,其中训练校准分数并增加注意力尺度,错误随时间减少。
-
新研究质疑梯度下降方法的最优性
两篇新研究论文探讨了梯度下降算法在机器学习中的理论基础和实际应用。第一篇论文分析了自然梯度下降(NGD),根据参数维度和函数属性确定了三个区域,对于高斯协方差等某些族,NGD的效率随着维度的对数而增长。第二篇论文证明,对于标准的凸优化,即使在无噪声情况下,梯度下降(或SGD)的最终迭代也无法在不知道总步数的情况下达到最优收敛速率。
-
新分析详细介绍了梯度下降在扰动目标上的差分隐私
研究人员开发了一种方法来分析梯度下降应用于扰动目标时的差分隐私。该方法包括在优化之前向目标函数添加一个随机线性项,然后检查所得最小化器的性质。该研究提供了梯度下降迭代保持隐私的条件,特别是对于具有利普希茨海森矩阵的强凸和平滑目标。对于广义线性模型,一旦满足某些迭代条件,这种隐私分析显示出不依赖于环境维度,并且优化误差呈几何级数下降。
-
逻辑回归过渡时间界限被证伪
研究人员已经证伪了关于在具有大常数步长的梯度下降下,可分离逻辑回归的过渡时间界限的猜想。此前,人们认为在维度大于或等于二的情况下,过渡时间将独立于步长。然而,本文证明了对于固定的样本量和足够小的裕度,过渡时间取决于步长的大小,具体来说,其缩放比例为 $(\log\eta)^{\min\{n-2,d-2\}}$。这一发现是通过控制对梯度影响最大的样本变化并构建匹配的困难实例来确立的。
-
主成分回归在线性回归中优于谱滤波器
一篇新发表在arXiv上的论文详细介绍了用于线性回归的各种谱滤波器的统计比较。研究表明,主成分回归(PCR)在包括梯度下降和岭回归在内的其他单调谱滤波器中始终表现更优。研究结果表明,PCR是线性回归任务中这些方法中的最优且可接受的选择。
-
新研究探索经典和量子优化加速 · 跟踪 2 个来源
两篇新研究论文探讨了复杂问题的先进优化技术,在经典物理和量子物理之间建立了联系。第一篇论文介绍了能量守恒下降(ECD)及其量子类似物(qECD),证明了在非凸目标方面相对于 SGD 等标准方法具有指数级加速。第二篇论文提出了“量子球”作为一种物理可实现的优化基准,在特定条件下证明了梯度下降和进化策略的线性收敛率。
-
主成分回归在线性回归谱滤波器中表现最佳
一篇新论文比较了线性回归的各种谱滤波器性能,包括主成分回归(PCR)、梯度下降(GD)和岭回归。研究表明,PCR 一贯优于其他单调谱滤波器,其风险仅比常数因子大,在某些情况下,风险会呈多项式级减小。这一发现扩展了先前的工作,并确立了 PCR 在这些滤波器中作为一种最优且可接受的选择。
-
梯度下降详解:优化神经网络
梯度下降是一种迭代优化算法,用于机器学习中最小化一个函数,通常是神经网络中的损失函数。它通过计算损失函数相对于网络权重的梯度(或斜率)来工作。然后,算法沿着梯度的相反方向进行迭代,以找到损失较低的点。学习率是一个关键的超参数,它决定了这些步长的大小,从而决定了模型收敛到最小值的速度。
-
研究探讨动量在大型语言模型损失景观优化中的作用
一篇新的研究论文探讨了大型语言模型中损失景观的“河谷”结构,提出动量加速在优化这些复杂环境中起着至关重要的作用。研究表明,动量有助于稳定较大的学习率,从而在景观中的“河流”低损失流形上实现更快的进展。这种理论分析旨在解释某些学习率调度器(如Warmup-stable-decay)的有效性,这些调度器在衰减学习率之前保持较高的学习率,这与Cosine Scheduling等方法形成对比。
-
研究论文详细介绍了梯度下降如何放大机器学习模型中的偏见
一篇新研究论文提出了一个形式化框架,用于理解梯度下降如何放大机器学习模型中的偏见,尤其影响少数群体。该研究通过深度学习实验进行了说明,揭示了标准的训练方法可能会偏向多数数据,导致刻板印象的预测器忽略少数群体的特定特征。研究结果突显了全数据预测器和刻板印象预测器之间的密切关系,并确定了一个主要学习多数群体特征的训练区域,从而为减轻这些偏见所需的额外训练设定了下限。
-
Transformer模型需要位置嵌入来理解词序
这篇技术文章通过构建一个简化的、手工构建的版本,解释了Transformer模型中位置嵌入的必要性。作者演示了当引入一个‘disobeys’(不服从)标记时,词序如何变得重要,该标记会改变后续单词的动作。为了处理这个问题,模型采用了残差连接和位置嵌入,使每个标记都能携带其位置信息。
-
新研究探索联想记忆体“稳定边缘”的几何优化
研究人员探索了高容量核逻辑回归(KLR)联想记忆体的几何特性,识别出一种被称为“优化之脊”的关键超参数区域。该区域以主曲率被放大的几何奇点为特征,紧邻秩-1谱坍塌。研究表明,受“稳定边缘”现象影响的梯度下降优化将网络参数推向这个高度弯曲的边界,从而实现最优记忆表征的形成。
-
论文对比了在KLR训练的Hopfield网络上梯度下降与自然梯度下降
一篇新论文分析了高容量联想记忆中学习动力学的几何,特别是核逻辑回归(KLR)训练的Hopfield网络。它在“优化脊”上比较了梯度下降(GD)和自然梯度下降(NGD),揭示了GD由于极端曲率而沿着不稳定的振荡路径。然而,NGD纠正了这种几何形状,沿着测地线路径收敛更快并产生更好的泛化。
-
新框架统一了用于统计分析的一阶优化不等式
一篇新论文介绍了用于一阶优化算法的“基本不等式”,提供了一个连接隐式和显式正则化的框架。该框架根据累积步长和迭代点之间的几何距离,对目标函数与参考点之间的差异进行界定。该研究扩展了梯度下降的现有结果,并为镜像下降和其他一阶方法提供了新的发现,其应用包括使用早期停止的梯度下降和指数梯度下降来推导广义线性模型中预测风险的界限。
-
新研究探索用于算子学习和优化的先进梯度下降方法
两篇新研究论文探讨了用于复杂优化问题的先进梯度下降技术。第一篇论文详细介绍了希尔伯特空间算子学习的随机梯度下降(SGD),建立了收敛速度和最小最大下界。第二篇论文引入了一种“记忆持久性”技术来增强随机子空间方法,提供了理论分析和在机器学习中的实际应用,特别是在稀疏或小批量结构目标方面。
-
新方法改进了流数据的核主成分分析
研究人员开发了一种新的核主成分分析(KPCA)方法,旨在处理流数据并适应随时间的变化。这种基于旋转的子空间跟踪方法通过将模型的估计旋转到新的数据点来更新模型,比单独使用传统的梯度下降方法具有更快的收敛速度。该技术包含一个鲁棒的影响函数,以减轻异常值的影响,使其适用于具有非线性模式和潜在数据漂移的真实世界数据集。
-
树张量网络揭示了尽管有困难目标,但仍存在良性损失景观
研究人员探索了深度神经网络为何尽管复杂但实际上通常能有效学习的理论基础。一项使用树张量网络(TTNs)的新研究表明,即使是具有内在学习困难目标的模型也可以拥有良性损失景观。研究结果表明,学习复杂目标的困难可能源于由秩亏缺引起的高阶退化鞍点,而不是局部最小值。
-
新理论解释浅层神经网络中的增量学习
研究人员开发了一个新的理论框架,用于理解浅层神经网络中的增量学习。这项工作侧重于在标准初始化下,在正交多指标目标上训练的多项式宽度两层网络。研究结果表明,增量学习仍然发生,损失根据目标的厄米展开式顺序下降,低阶分量先于高阶分量被学习。