stochastic gradient descent
PulseAugur coverage of stochastic gradient descent — every cluster mentioning stochastic gradient descent across labs, papers, and developer communities, ranked by signal.
- instance of Influence Flower 90%
- instance of ScienceCast 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- used by Deep Neural Networks 70%
- used by Neural tangent kernel 70%
- competes with Adam optimizer 70%
- used by Gaussian Processes 70%
- used by partial differential equations 70%
- instance of Deep Neural Networks 70%
- used by Influence Flower 60%
- used by Adam optimizer 50%
4 天有情绪数据
-
新研究为神经网络训练提供理论收敛保证
两篇新研究论文探讨了神经网络训练的理论基础。第一篇论文通过引入广义 Lipschitz 光滑性条件,为通用前馈神经网络中的梯度下降建立了收敛保证。第二篇论文提出了一种深度神经网络训练的统一优化框架,通过 Legendre 函数和共轭变换推广了凸性和光滑性,并引入了具有理论收敛率的广义梯度下降和 SGD。
-
弱相关性原理解释了基于梯度的学习系统中的线性化
一篇新发表在arXiv上的论文探讨了弱相关性原理是观察到的基于梯度的学习系统线性化的根本原因。研究表明,深度学习模型中看到的简化动力学,尤其是在无限极限下,可以归因于假设函数相对于参数的一阶和高阶导数之间的弱相关性。这一见解在宽神经网络中得到了证明,并导致了在随机梯度下降训练期间偏离线性的推导界限。
-
研究人员分析具有不连续性的随机梯度下降
研究人员分析了当随机梯度下降(SGD)应用于在低维流形上表现出不连续性的损失函数时的行为。该研究侧重于SGD的微分方程极限,以理解其在这些复杂场景下的行为。这项工作在arXiv上发表,属于统计学 > 机器学习类别。
-
新研究概述了SGD预处理器的设计,以实现稳定性和降噪
一篇新发表在arXiv上的研究论文详细介绍了随机梯度下降(SGD)预处理器的设计标准,重点关注局部条件、噪声底和盆地稳定性。该论文推导了收敛速率和噪声底受对称正定矩阵M影响的界限。对于非凸目标,它建立了依赖于预处理器的盆地稳定性保证,这对于科学机器学习(SciML)应用尤其重要,因为在这些应用中物理保真度和数值稳定性至关重要。在诊断和SciML基准测试上的实验验证了所提出的通过选择M来改善局部条件并降低噪声的设计原则。
-
研究论文详述线性回归模型中的“良性拟合不良”现象
一篇新的研究论文探讨了线性回归模型中“良性拟合不良”的现象,即在训练数据上表现不佳的模型仍然可以很好地泛化到新的、未见过的数据。这种情况发生在一个特定的区域,其中训练集的大小远大于维度数量,但小于直接插值所需的数量。研究表明,即使在经验训练误差很高的情况下,诸如随机梯度下降(SGD)之类的方法也可以在此预测的“第四象限”中实现较低的测试误差。
-
新研究探索使用紧凑支撑径向基函数进行概率密度建模
研究人员探索了使用紧凑支撑径向基函数(CS-RBF)作为一种新颖的概率密度函数参数族,特别关注Wendland $\mathscr{C}^2$ 核。该研究在单变量和条件设置中提供了矩和累积分布函数等统计属性的解析表达式,并考虑了截断和非截断支撑的场景。还介绍了一种使用CS-RBF混合模型进行密度估计的增量学习算法,该算法在合成和真实世界数据集上展示了与高斯混合模型相比具有竞争力的性能。
-
新方法准确归因 Adam 优化器中的数据贡献
研究人员开发了一种名为 Adam-Aware In-Run Data Shapley 的新方法,用于准确归因使用 Adam 优化器的机器学习模型中的数据贡献。现有方法依赖于随机梯度下降 (SGD) 的线性结构,但由于 Adam 复杂的动态特性而对其无效。所提出的技术实现了与真实边际贡献近乎完美的保真度,并保持了约 95% 的标准训练吞吐量。这种新方法在下游数据归因任务中的表现明显优于基于 SGD 的基线。
-
研究论文详述学习率冷却的有效性如何取决于噪声和优化器归一化
一篇新的研究论文探讨了学习率冷却阶段在大型模型预训练中的有效性,这是预热-稳定-衰减(WSD)调度的一个常见组成部分。研究表明,这种冷却的好处取决于梯度噪声的结构与优化器是否采用归一化之间的相互作用。在没有归一化的情况下,随机梯度下降(SGD)会自然收缩,并且从冷却中获益甚少。然而,归一化方法和SignSGD可能会陷入噪声地板,此时冷却可能根据具体的噪声特性提供改进。
-
新算法CREATE-IF-LATE可应对分散式学习中的“Pac-Man攻击”
研究人员开发了一种名为CREATE-IF-LATE (CIL) 的新算法,以应对分散式学习中的一种新型威胁,即“Pac-Man攻击”。这种攻击涉及恶意节点概率性地终止访问它的随机游走(RWs),导致活跃RWs逐渐灭绝,并在不被察觉的情况下停止学习过程。CIL被设计为一种完全分散式且具有弹性的机制,可确保RWs的自创建,即使在Pac-Man攻击下也能防止其灭绝。理论分析表明,CIL保证了RW种群的非灭绝性和有界性,并使随机梯度下降能够收…
-
新框架精确模拟高维多类SGD动力学
研究人员开发了一个新框架,用于分析高维设置下多类随机梯度下降(SGD)的学习动力学。该框架提供了关键指标(如风险和信号重叠)的精确表达式,这些表达式在高维极限下表示为常微分方程的确定性系统。这种方法适用于广泛的优化问题,并能适应类别数量随维度增加的情况。该研究详细介绍了数据各向异性对二元逻辑回归和最小二乘损失的影响,确定了后者的学习率阈值以及前者的结构相变,尤其是在具有稀疏协方差矩阵的模型中。
-
新的ETBQ方法可提高低比特神经网络量化精度
研究人员开发了一种名为高效量化前调优(ETBQ)的新方法,以提高深度神经网络低比特训练后量化(PTQ)的精度。该技术包括一个预处理调优阶段,在PTQ过程之前优化全精度模型,使其对量化误差不那么敏感。ETBQ不需要训练假量化模型,因此计算效率很高。在ImageNet和Cityscapes等各种数据集上的实验表明,ETBQ在不同任务中显著提高了低比特PTQ的性能。
-
无调度优化方法在非凸环境中实现最优收敛速率
一篇新论文探讨了非凸优化中无调度方法的理论基础,非凸优化在机器学习中很常见。该研究为无调度梯度下降及其随机变体提供了最坏情况收敛速率分析,证明它们能实现一阶方法的最佳速率。研究还证明了这些方法可以避免严格鞍点,为它们的强大实证性能提供了理论解释。
-
贝叶斯教师提升AI模型蒸馏的准确性和稳定性
一篇新的研究论文通过贝叶斯视角探讨了知识蒸馏(KD),并分析了学生模型在随机梯度下降(SGD)下的收敛性。研究表明,与确定性教师相比,使用贝叶斯深度学习模型作为教师可以将准确率提高高达4.27%,并将收敛噪声降低高达30%。这些发现表明,贝叶斯教师能提供更好的贝叶斯类别概率(BCPs)估计,从而增强学生模型的泛化能力和稳定性。
-
新EISAM优化器增强深度学习泛化能力
研究人员推出了一种名为“受外梯度启发的锐度感知最小化”(EISAM)的新型优化器,旨在提高深度学习的泛化能力。EISAM采用两步过程,包括预测和扰动步骤,以导航损失景观并找到更平坦的最小值。该方法旨在减少过拟合并提高在未见数据上的性能,其表现优于SGD和Adam等传统优化器以及标准的SAM。EISAM还显示出对扰动半径的敏感性降低,从而简化了调整并提高了跨各种架构和数据集的鲁棒性。
-
新的自适应Adam优化器提高了深度学习求解偏微分方程的收敛性
一篇新论文介绍了一种学习率自适应的Adam优化器变体,旨在提高深度学习的收敛性,特别是在求解偏微分方程方面。所提出的方法根据目标函数的经验估计来调整学习率,旨在克服标准Adam和具有恒定学习率的SGD的局限性。数值模拟表明,与默认的Adam优化器相比,目标函数值减少得更快,并且理论分析为某些自适应SGD变体收敛到全局最小值的严格证明提供了依据。
-
新的热力学框架将神经网络训练建模为理想气体行为
研究人员开发了一个热力学框架,用于分析使用随机梯度下降(SGD)训练的尺度不变神经网络的训练动力学。该框架将学习率和权重衰减等训练超参数与温度和压力等热力学变量进行了类比。研究发现 SGD 动力学与理想气体的行为之间存在很强的相关性,这得到了理论分析和模拟的支持。这种方法为理解神经网络训练提供了新的视角,并可能为未来的超参数优化和学习率调度方法提供信息。
-
新研究保证了 SGD 训练的物理信息神经网络的收敛性
研究人员已经证明,在求解泊松方程时,随机梯度下降(SGD)训练过参数化两层物理信息神经网络(PINNs)的线性收敛性。该分析考虑了随机优化方法引入的动态随机性,为 SGD 训练的 PINNs 提供了收敛保证,扩展了先前的工作。该分析的关键在于确保训练过程中特定 Gram 矩阵的正定性。
-
论文分析基于分数的生成模型的SGD收敛性
研究人员发表了一篇论文,分析了基于分数的生成模型(SGMs)训练的优化动力学。该研究侧重于随机梯度下降(SGD),并为一般的分数参数化提供了收敛速率,同时考虑了权重因子。此外,对于过参数化的双层ReLU网络,该论文使用神经切线核(Neural Tangent Kernel)分析来确定SGD轨迹上的分数近似误差界限。研究结果为重排因子在SGMs分数近似中的影响提供了理论指导。
-
新研究详解基于分数的生成模型SGD收敛性
研究人员发表了一篇论文,详细介绍了随机梯度下降(SGD)应用于基于分数的生成模型(SGMs)时的非渐近收敛性。该研究为训练SGMs的SGD提供了理论保证,解决了优化动力学问题,而这方面的研究比其采样过程的研究要少。该工作为一般分数参数化建立了收敛率,并使用神经切线核分析了过参数化网络,为实际中的权重选择提供了指导。
-
LoRA技术赋能大型AI模型高效微调
多篇文章讨论了大型语言模型的微调,特别关注LoRA(低秩适配)技术。LoRA通过仅训练一小部分参数来实现大型模型的有效适配,使其在性能较低的硬件上也能实现。该方法与需要大量计算资源的全量微调形成对比。文章还涉及了Adam等优化算法,这对于这些大型模型的实际训练至关重要,并探讨了机器学习模型的更广泛发展历程。