stochastic gradient descent
PulseAugur coverage of stochastic gradient descent — every cluster mentioning stochastic gradient descent across labs, papers, and developer communities, ranked by signal.
- instance of Gotit.pub 90%
- instance of Influence Flower 90%
- instance of alphaXiv 70%
- used by alphaXiv 70%
- instance of CatalyzeX 70%
- instance of cs.LG 70%
- used by Neural tangent kernel 70%
- used by partial differential equations 70%
- used by Deep Neural Networks 70%
- instance of Deep Neural Networks 70%
- used by Gaussian Processes 70%
- competes with Adam optimizer 70%
5 天有情绪数据
-
Ising 与 QUBO 编码对玻尔兹曼机学习收敛性的影响
一篇新的研究论文评估了 Ising 和 QUBO 变量编码在玻尔兹曼机学习中的性能。研究发现,QUBO 编码可能导致 Fisher 信息矩阵的病态,从而导致随机梯度下降的收敛速度变慢。然而,使用自然梯度下降或适当的预处理技术可以缓解这些问题,从而在两种编码类型之间实现相似的收敛速度。这些发现为选择玻尔兹曼机的变量编码和预处理方法提供了实用的指导。
-
随机梯度下降破坏线性自编码器中的尺度对称性,偏好大的解码器权重
研究人员在欠完备线性自编码器中发现了一种现象,其中有限步长的随机梯度下降(SGD)会破坏尺度对称性。此过程偏好主成分分析(PCA)解流形上的大解码器权重,导致定向尺度漂移。虽然这种漂移在解析上是可处理的,但它最终会遇到稳定性边界,导致根据某些度量标准,解具有更尖锐的特征,尽管其他尖锐度度量可能会朝相反方向移动。
-
新理论分析深度学习优化收敛性
研究人员开发了一个新的理论框架,用于分析深度学习中使用的优化算法的收敛特性。这种方法借鉴了遍历理论,研究了随机梯度下降等算法接近最小化器的预期时间。研究结果表明,在包括高斯噪声和亚指数噪声在内的假设下,该命中时间围绕其平均值呈指数分布,平均值由目标函数的平稳测度决定。
-
新研究探索用于算子学习和优化的先进梯度下降方法
两篇新研究论文探讨了用于复杂优化问题的先进梯度下降技术。第一篇论文详细介绍了希尔伯特空间算子学习的随机梯度下降(SGD),建立了收敛速度和最小最大下界。第二篇论文引入了一种“记忆持久性”技术来增强随机子空间方法,提供了理论分析和在机器学习中的实际应用,特别是在稀疏或小批量结构目标方面。
-
新方法近似P2上的随机梯度下降
研究人员开发了一种新颖的方法来近似概率测度上的随机梯度下降(SGD)动力学,特别是在Wasserstein空间P2内。通过将问题提升到一个线性的希尔伯特空间并利用Lions可微性,他们构建了一个高斯随机场近似。该近似匹配原始随机梯度的均值和协方差,并以二阶弱精度捕捉SGD动力学,为在随机优化中用解析上可处理的高斯涨落替换样本驱动的随机性提供了一种严谨的方法。
-
新的批量SGD方法提供高概率收敛保证
研究人员推出了一种新颖的随机梯度下降(SGD)变体——批量SGD,旨在为优化问题实现高概率收敛保证。该方法将在线样本划分为多个周期(epochs),每个周期使用一个精炼的梯度估计进行一次更新。该方法通过避免严格的假设和辅助序列来简化分析,为强凸和非凸目标都提供了近乎最优的收敛速率。此外,批量SGD还扩展到联邦学习领域,为该领域提供了首个具有对数通信复杂度和对数据异质性韧性的高概率保证。
-
四篇arXiv论文推进随机优化理论 · 跟踪4个来源
四篇新研究论文发表在arXiv上,探讨了随机优化方法的高级收敛性质。第一篇论文为具有收缩性、马尔可夫性和乘性噪声的随机逼近的稳态收敛性引入了统一理论,在Wasserstein-2距离上实现了最优的$O(\sqrt{\alpha})$速率。另一篇论文证明了带裁剪和加性高斯噪声的随机梯度下降的几乎处处收敛性,并将其扩展到动量变体。第三项研究分析了重尾噪声和Hölder平滑下SGD的收敛速率,为具有挑战性条件下的梯度裁剪方法提供了新的保证。…
-
新研究论文将z变换方法应用于二次优化
一篇新论文探讨了z变换方法在二次优化问题中的应用。研究表明,这种通常用于信号处理和控制论的经典工具,可以为优化算法带来新颖的渐近结果。该研究将分析范围从基本的梯度下降扩展到Nesterov加速和随机梯度下降等更复杂的方法,并强调了频谱维度在表征收敛行为中的作用。
-
新框架限制神经网络中的信息获取
研究人员开发了一个新框架,用于理解神经网络在学习过程中如何获取信息。通过将随机梯度下降(SGD)建模为马尔可夫随机过程,他们推导出了费舍尔信息流的速率限制。该限制量化了可训练参数能够多快地学习到数据中的潜在变量,区分了确定性学习力和SGD引起的波动的作用。该框架通过基函数线性回归进行了验证,准确预测了不同潜在变量的编码时间尺度。
-
新研究推进机器学习随机优化 · 跟踪5个来源
几篇近期研究论文探讨了随机优化技术的进展,特别关注梯度下降及其变体在复杂机器学习问题中的应用。其中一篇论文表明,即使存在重尾噪声,标准的随机梯度下降上升(SGDA)也能收敛,而无需梯度裁剪,并为正则化问题引入了新的无裁剪算法。另一项研究通过关注梯度映射,在约束凸凹极小极大优化方面取得了近乎最优的收敛率。此外,研究还探讨了平滑凸目标函数的随机梯度下降(SGD)的精确收敛率,确立了理论极限,并分析了使用预定步长的梯度下降加速的最优性。最后…
-
新框架分析基础模型中的注意力动力学
研究人员开发了一个名为注意力索引模型的新框架,以更好地理解大型基础模型中注意力机制的训练动力学。该框架揭示了这些模型的优化景观可以由特定的序参数来表征。研究还表明,注意力参数化本身可以引入隐式偏差,影响模型的学习过程,并可能导致有助于恢复的对称性破坏机制。
-
Adam 优化器获得首次无条件误差分析
研究人员开发了一个新的理论框架,为 Adam 随机梯度下降优化方法提供统一的先验界和误差分析。这项工作通过首次为 Adam 应用于强凸随机优化问题提供无条件误差分析,解决了长期存在的学术难题。此前的分析是有条件的,假设 Adam 的参数保持均匀有界。
-
SGD 动力学被建模为渗透过程,并扩展到 Adam 和 AdamW
研究人员将随机梯度下降 (SGD) 的动力学建模为渗透过程,揭示了架构对称性如何导致子网络以离散块的形式合并。这些转变会导致方差激增,类似于物理相变。该研究进一步证明,当 Adam 和 AdamW 等优化算法受到重尾噪声影响时,这种捕获机制及其尺度级联也适用于它们。
-
子空间Levenberg-Marquardt算法在神经网络训练中的评估
研究人员评估了子空间Levenberg-Marquardt算法在神经网络训练中的应用,旨在提高大型模型的效率。这些子空间方法,包括Krylov子空间LM和混合子空间LM,与经典的Levenberg-Marquardt算法以及SGD和Adam等一阶方法进行了比较。该研究侧重于它们在回归和分类任务中的表现。
-
新的经验贝叶斯方法增强了广义线性模型
研究人员开发了一种新颖的经验贝叶斯方法来拟合贝叶斯广义线性模型,引入了一种均场变分推断方法,该方法在算法内估计先验,使其无需调优。该方法优化后验均值和先验参数,支持 L-BFGS 和随机梯度下降等可扩展优化算法。该框架统一了指数族分布,并在稀疏逻辑回归应用中展示了优于现有方法的预测性能。
-
新的自适应停止规则提高了随机优化中 SGD 的效率
研究人员为随机梯度下降 (SGD) 等随机优化算法开发了新的轨迹自适应停止规则。这些规则解决了理论固定时间分析与实际自适应停止决策之间的不匹配问题,确保了统计有效性。该方法使用置信上限序列来界定优化误差和次优性,实现了最优衰减率并适应实际梯度。这种方法允许 SGD 一旦达到所需的精度即可高效停止,可能比传统的确定性时间范围需要更少的迭代次数,并且已扩展到小批量 SGD。
-
Anytime Pretraining 采用无视界 LLM 训练和权重平均
研究人员推出了一种新颖的大型语言模型训练方法“Anytime Pretraining”,该方法无需预定义训练视界。该方法结合了无视界学习率调度和权重平均,在最终损失方面与传统的余弦衰减调度相当。研究结果表明,这种随时可用的策略为大型语言模型预训练提供了一种实用且有效的方法,尤其是在开放式训练场景中。
-
新研究探索使用Graphon粒子系统进行分布式优化
研究人员引入了Graphon粒子系统作为一种方法来分析节点连续体中的分布式优化问题。该研究提出了为该 graphon框架设计的随机梯度下降和梯度跟踪算法。该论文为节点状态的二阶矩建立了理论界限,证明了其一致有界性,并在强凸等特定条件下,证明了其收敛到全局成本函数的最小化器。
-
新研究为神经网络训练提供理论收敛保证
两篇新研究论文探讨了神经网络训练的理论基础。第一篇论文通过引入广义 Lipschitz 光滑性条件,为通用前馈神经网络中的梯度下降建立了收敛保证。第二篇论文提出了一种深度神经网络训练的统一优化框架,通过 Legendre 函数和共轭变换推广了凸性和光滑性,并引入了具有理论收敛率的广义梯度下降和 SGD。
-
弱相关性原理解释了基于梯度的学习系统中的线性化
一篇新发表在arXiv上的论文探讨了弱相关性原理是观察到的基于梯度的学习系统线性化的根本原因。研究表明,深度学习模型中看到的简化动力学,尤其是在无限极限下,可以归因于假设函数相对于参数的一阶和高阶导数之间的弱相关性。这一见解在宽神经网络中得到了证明,并导致了在随机梯度下降训练期间偏离线性的推导界限。