gradient descent
PulseAugur coverage of gradient descent — every cluster mentioning gradient descent across labs, papers, and developer communities, ranked by signal.
- used by Deep Neural Networks 90%
- affiliated with stochastic gradient descent 90%
- used by logistic regression model 90%
- competes with stochastic gradient descent 70%
- instance of Deep Neural Networks 70%
- used by Hessian 70%
- instance of stochastic gradient descent 70%
- used by alphaXiv 70%
- used by artificial neural network 70%
- instance of cs.LG 70%
- used by deep learning 70%
- instance of DagsHub 70%
13 天有情绪数据
-
受量子物理学启发的新的张量网络学习方法
研究人员介绍了一种利用张量网络的新机器学习方法,该方法借鉴了量子多体物理模拟的灵感。所提出的基于矩阵乘积态(MPS)或张量链的架构通过梯度下降进行优化。该研究探讨了两种优化方法,包括密度矩阵重整化群(DMRG)的改编,以寻找局部最优张量,并比较了它们的有效性。
-
新理论重塑深度学习中的优化器稳定性
研究人员在深度学习中发现了一种现象,即基于梯度的优化器在理论预测的不稳定阈值之上保持稳定的Hessian特征值。这种偏差,观察到高达预测边界的21.1倍,是系统性的,并且取决于所使用的特定优化器。该研究提出了一种基于方向Hessian和梯度对齐得分的稳定性阈值的新表述,该表述考虑了优化器的实际更新,并提供了新的诊断工具来理解其在优化过程中平衡时间和空间预算中的作用。
-
梯度下降方法可靠地合成最优量子电路
研究人员开发了一种新颖的基于梯度的优化框架,用于合成量子电路。这种新方法能够可靠地找到通用酉变换的深度和门最优电路,克服了先前方法中通常需要过度参数化或成功率低的问题。该框架规定了参数最优的电路骨架,消除了对随机组合搜索的需求,并确保了即使在硬件连接受限的情况下也能实现参数效率。
-
新arXiv论文详述独立成分分析的基础
本文深入探讨了线性独立成分分析(ICA)的数学基础,面向具有测度论概率论背景的读者。文章详细介绍了概率测度的特征函数理论,并探讨了在对源施加越来越严格的假设下ICA模型的辨识结果。该研究还介绍了一种在线等变梯度下降算法,用于在标准的无噪声、非高斯ICA场景中恢复独立的源。
-
新理论统一了逆最优传输的统计和算法方法
一篇新论文介绍了 Sinkhorn 线性化和谱代理,以统一特征参数化逆最优传输的统计和算法理论。该研究开发了一个核心界限,驱动了四个定理和一个观察结果,解决了可识别性、稀疏一致性、适定性和估计量的收敛性问题。研究结果包括恢复真实参数的理论保证和梯度下降的收敛率,并评估了误设的影响。
-
新方法加速高维函数深度神经网络训练
研究人员开发了一种新颖的方法来加速高维函数的深度神经网络训练。该方法将上下文特征集成到网络的初始层,然后与网络参数一起使用梯度下降进行优化。该方法特别利用张量网络分解策略来处理复杂特征,从而显著降低存储成本,并能够高效训练维度范围从 5 到 40 的模型。
-
新的 arXiv 论文探讨机器学习的优化算法
两篇新的 arXiv 论文探讨了机器学习优化算法的进展。第一篇论文介绍了流形约束最速下降法 (MCSD) 及其切线投影变体 (MCSD-TP),用于最小化复杂可行集上的函数,并专门针对 Stiefel 流形提出了 SPEL 方法。第二篇论文为梯度下降法的步长加速设定了下界,证明了仅靠步长调度无法实现光滑凸优化的最优收敛速率。
-
新研究为神经网络训练提供理论收敛保证
两篇新研究论文探讨了神经网络训练的理论基础。第一篇论文通过引入广义 Lipschitz 光滑性条件,为通用前馈神经网络中的梯度下降建立了收敛保证。第二篇论文提出了一种深度神经网络训练的统一优化框架,通过 Legendre 函数和共轭变换推广了凸性和光滑性,并引入了具有理论收敛率的广义梯度下降和 SGD。
-
新的梯度下降方法在分类中实现最优风险
研究人员开发了一种新的方法,在过参数化数据的分类任务中使用带早停的梯度下降。该技术旨在实现最小最大最优的过量零一风险,特别是在具有标签翻转噪声的高斯混合模型中。与标准梯度下降相比,该方法提供了统计上更优越的结果,尤其是在处理多项式和指数谱衰减时,并通过实验结果得到了验证。
-
Adam优化器在因子模型中与梯度下降不同
一篇新的研究论文探讨了Adam和梯度下降等优化算法在应用于因子模型时行为的差异。研究表明,虽然梯度下降由于损失函数的规范对称性而隐式地偏向于低秩解,但Adam和类似的逐坐标优化器不具备这种偏向。这种差异归因于规范等变性,它对于从梯度流转移性质是必需的,但不足以恢复低秩。该研究根据恢复误差对九种更新规则进行了排序,发现Adam在Transformer中分离了规范等价的初始化,导致每个头的逆变器存在显著差异。
-
逻辑回归参数向量弱地与最大间隔方向对齐
研究人员从理论上证明,在特定迭代次数内,逻辑回归的参数向量会弱地与最大间隔方向对齐。这种在渐近收敛之前观察到的早期对齐现象,对于理解为何训练时间越长通常泛化能力越好至关重要。研究结果表明,这种弱对齐比之前理解的要快,并直接与数据集几何结构相关。
-
Adam优化器打破了因子模型中的低秩偏差,而梯度下降则不会
一篇新论文揭示,虽然梯度下降由于规范等变性而隐式地偏好因子矩阵模型中的低秩解,但流行的Adam优化器却不会。这种差异归因于Adam的每坐标二阶矩计算,它打破了梯度下降所遵循的对称性。实验表明,像Adam和RMSProp这样的优化器会丢失这种低秩偏差,导致在矩阵感知和Transformer等任务上的性能不如梯度下降和其他等变优化器。研究表明,各向异性而不是自适应性是影响这种偏差的关键因素。
-
广义二次梯度框架统一优化方法
研究人员引入了广义二次梯度(GQG),一个统一和扩展现有二阶优化方法的新型优化框架。GQG抽象了二次梯度(QG)和简化二次梯度(SQG)的核心原理,证明了满足局部二次模型平稳条件的正定曲率矩阵足以进行构建。这种泛化允许开发超越传统Hessian近似的新型感知曲率的优化算法,在深度学习中具有潜在应用。
-
Muon 优化器在理论和实践神经网络训练中展现出潜力
两篇新的研究论文探讨了 Muon 优化器,这是一种旨在更好地处理神经网络中矩阵结构参数的方法。第一篇论文介绍了一种用于 Sharpness-Aware Minimization (SAM) 的矩阵感知几何,将谱内扰动与 Muon 结合,以提高 ImageNet-1K 上的鲁棒性和验证准确性。第二篇论文对 Muon 进行了理论收敛性分析,证明了它通过利用神经网络训练中 Hessian 矩阵的低秩结构,有潜力超越传统的梯度下降。
-
新的PSO变体通过自适应梯度和超图拓扑增强优化 · 跟踪4个来源
研究人员开发了增强粒子群优化(PSO)的新方法,PSO是一种元启发式算法。一种方法,自适应混合PSO(AHPSO),根据群体多样性智能地调节梯度影响,在特定类型的问题上表现出改进的性能。另一个框架,AutoPSO,通过探索组件池并利用批量评估提高效率来自动化定制PSO变体的构建。此外,超图辅助粒子群优化(HPSO)利用超图对粒子拓扑进行建模,实现多个粒子之间的直接交互,并在基准套件上显示出有效性。
-
深度伽辽金法和物理信息神经网络算法已被证明可收敛于偏微分方程解
研究人员已从数学上证明,深度伽辽金法(DGM)和物理信息神经网络(PINNs)能够可靠地收敛到一类特定的半线性偏微分方程(PDEs)的正确解。这些在科学机器学习中广泛使用的方法通过最小化PDE残差来训练神经网络以逼近PDE解。尽管此前由于目标函数的非凸性存在关于收敛到局部极小的理论担忧,但这项新工作确立了对于这些类型的方程,梯度下降确实会导向准确的PDE解。
-
Anthropic CEO阐述对开放权重AI模型的立场
Anthropic首席执行官Dario Amodei阐述了公司对开放权重模型的立场,表示Anthropic从未主张禁止它们。他强调,不具备危险能力的开放权重模型是公共产品,但对威权政府将强大AI用于军事或监控目的表示担忧。Amodei还支持限制向中国销售芯片以及打击工业规模的蒸馏操作等措施,以减轻这些风险。
-
新的元学习算法应对AI优化挑战
研究人员推出了一种名为贪婪动力学元学习(Greedy dynamical meta-learning)的新型元学习算法,旨在克服现有大型AI模型优化方法的局限性。该算法采用双循环结构:内循环中代理优化自身参数,外循环则优化内循环的过程。这种方法通过使代理能够修改自身的权重和偏差来加速学习,并利用零阶方法处理外循环,因为其参数空间维度较低。
-
指令调优通过任务特定微调提升LLM性能
指令调优是通过在特定任务和指令上微调大型语言模型(LLMs)来增强其能力的关键方法。此过程提高了模型理解和准确响应用户输入的能力,使其更加通用。该技术涉及使用梯度下降等优化算法最小化损失函数来调整模型参数。指令调优在客户服务聊天机器人、语言翻译和文本摘要等领域有实际应用。
-
论文解释了为何相对位置编码能提升 Transformer 的泛化能力
一篇新论文提出了一个基于优化的解释,说明为何具有相对位置编码的 Transformer 比具有绝对编码的 Transformer 在泛化到更长序列时表现更好。研究表明,梯度下降的隐式偏差在使用 Rotary Encodings 时倾向于有利于对相对位置具有等变性的解,从而在不同序列长度下实现一致的性能。相比之下,绝对编码倾向于记忆特定位置,阻碍了外插。该研究通过在最小检索任务和全序列长度泛化任务上的实验证实了这些发现,并指出线性注意力…