SGD
PulseAugur coverage of SGD — every cluster mentioning SGD across labs, papers, and developer communities, ranked by signal.
- instance of stochastic gradient descent 95%
- instance of gradient descent 90%
- used by Neural tangent kernel 80%
- used by Gotit.pub 70%
- instance of Gotit.pub 70%
- used by DagsHub 70%
- instance of DagsHub 70%
- authored ScienceCast 70%
- instance of ScienceCast 70%
- authored Gotit.pub 70%
- authored by alphaXiv 70%
- used by stochastic gradient descent 70%
12 天有情绪数据
-
Symmetry-Aware Feature Learning Shows Polynomial Advantage Over Agnostic Methods
研究人员证明了在多指标模型中,对称感知和对称不可知特征学习在样本复杂度上存在显著的多项式分离。该研究侧重于具有循环对称性的高维高斯协变量,比较了三种方法:架构权重共享、数据增强以及无对称性感知学习。研究结果表明,与对称不可知学习器相比,对称约束的卷积网络和使用全组数据增强训练的网络在样本效率方面均表现更优,提供了多项式优势。
-
新研究质疑梯度下降方法的最优性
两篇新研究论文探讨了梯度下降算法在机器学习中的理论基础和实际应用。第一篇论文分析了自然梯度下降(NGD),根据参数维度和函数属性确定了三个区域,对于高斯协方差等某些族,NGD的效率随着维度的对数而增长。第二篇论文证明,对于标准的凸优化,即使在无噪声情况下,梯度下降(或SGD)的最终迭代也无法在不知道总步数的情况下达到最优收敛速率。
-
新研究表明 SGD 对重尾噪声具有鲁棒性
一篇新论文研究了随机梯度下降 (SGD) 在面对重尾噪声(现代机器学习中的常见问题)时的理论能力。该研究为 vanilla SGD 在各种问题类别(包括凸、强凸和非凸目标)中建立了收敛保证。这些发现表明,即使在噪声方差无界的场景中,SGD 仍然是一个鲁棒且理论上可靠的基线,挑战了先前对其局限性的假设。
-
新方法延迟扩散模型记忆,延长泛化能力
研究人员开发了一种名为质量门控去白化(QGD)的新方法,用于控制扩散模型中训练数据的记忆。该技术旨在延迟模型开始复制训练样本的时间点,从而延长有用泛化的周期。QGD通过保持快速的初始更新阶段,然后逐渐恢复动量来工作,并通过分析将不同类型的记忆分开。在CIFAR-10子集上进行测试时,QGD显著扩展了扩散模型的有用区间,并与标准SGD相比减少了复制,同时还实现了更好的FID分数。
-
新基准TPBench评估对话压缩方法
研究人员推出TPBench,一个旨在通过关注特定信息目标而非单一保留分数来评估对话压缩方法的新基准。TPBench评估模型在保留用户初始目标(P1)、修订槽位的当前值(P2)以及两者(P3)的能力,尤其是在具有后期槽位更新的对话中。使用TPBench在MultiWOZ和SGD等数据集上,并使用Llama和Mistral AI等阅读器进行评估,结果显示,当前压缩方法在恢复更新槽位值方面,尤其是在与完整上下文相比时,表现明显不足。
-
研究论文分析SGD在学习同一性函数时选择解决方案
一篇新研究论文探讨了随机梯度下降(SGD)在深度线性残差网络中学习同一性函数时如何选择特定解决方案。尽管存在许多可最小化总体损失的解决方案,但SGD始终偏好特定的解决方案,这可以通过熵损失的视角来理解。这个熵项会惩罚小批量梯度期望的平方范数,有助于区分网络层之间同一性的不同功能分解。该研究分析性地描述了这种熵损失的最小化器,并利用这些预测来解释SGD训练网络的观察行为。
-
新论文对SGD方法进行资讯理论分析
一篇新论文提出对随机梯度下降(SGD)及其变体进行资讯理论分析,提供了一种替代传统几何方法的研究途径。该研究表明,预处理的SGD步骤等同于高斯贝叶斯模型的后验均值更新。该框架允许将SGD的单步遗憾精确分解为内在时间成本和比较器资讯的变化,提供了一个统一的恒等式,涵盖了凸收敛、鞍点逃逸和泛化等各种SGD方面。
-
新算法 'Throttle' 增强了异步 SGD 的鲁棒性
研究人员开发了一种名为 Throttle 的新算法,它是异步 SGD 的拜占庭鲁棒泛化。该方法会指数级地降低来自更快客户端的更新的权重,这一因素即使在非攻击场景下也能提高性能。理论分析和经验验证证明了 Throttle 的收敛速度和对攻击的鲁棒性。
-
决策导向学习中识别出雅可比矩阵秩崩溃
研究人员在决策导向学习(DFL)中识别出一种称为雅可比矩阵秩崩溃的现象,其中预测器的雅可比矩阵表现出低秩。这种情况意味着优化器使用的梯度是共线的,限制了学习可用的独立参数更新方向。跨越各种配置(包括公平性、最短路径和背包问题)的实验表明,虽然 DFL 可以提供决策质量的适度改进,但这些收益通常是边际的,并且可能对坐标缩放和预测准确性与决策质量等因素敏感。
-
新型 SignGD 模型解决语言建模中的类别不平衡问题
一篇新的 arXiv 论文介绍了一种名为 SignGD 的最小模型,旨在解决机器学习中的类别不平衡问题,尤其是在语言建模领域。由 Robin Yadav 领导的研究表明,SignGD 通过消除稀有 token 更新的幅度依赖性,其表现优于标准的随机梯度下降 (SGD)。这种机制使得 SignGD 能够更有效地学习稀有 token,与 GD 和 SGD 相比,在重尾数据分布下具有可证明的收敛速率优势。
-
新研究探索经典和量子优化加速 · 跟踪 2 个来源
两篇新研究论文探讨了复杂问题的先进优化技术,在经典物理和量子物理之间建立了联系。第一篇论文介绍了能量守恒下降(ECD)及其量子类似物(qECD),证明了在非凸目标方面相对于 SGD 等标准方法具有指数级加速。第二篇论文提出了“量子球”作为一种物理可实现的优化基准,在特定条件下证明了梯度下降和进化策略的线性收敛率。
-
新的 Throttle 算法增强了异步 SGD 的鲁棒性和性能
研究人员开发了一种名为 Throttle 的新算法,它是异步 SGD 的拜占庭鲁棒泛化。该方法通过指数级地降低来自更快客户端的更新的权重来解决标准异步 SGD 中的漏洞。Throttle 提供了理论收敛保证,并对其实施攻击的鲁棒性进行了实证验证。有趣的是,即使不存在拜占庭攻击,这种降权机制也比标准异步 SGD 表现出更好的性能。
-
arXiv新论文详述高级SGD优化技术 · 已追踪2个来源
arXiv上发布的两篇新研究论文探讨了随机梯度下降(SGD)的高级优化技术。第一篇论文“常数步长SGD的尖锐平稳高斯近似”(Sharp Stationary Gaussian Approximation for Constant-Stepsize SGD),作者是Junghoon Seo,在特定条件下为用高斯分布近似SGD的不变定律提供了理论框架。第二篇论文“重尾噪声和$(L_0,L_1)$-平滑下裁剪SGD的高概率收敛性”(High…
-
AF-Muon 优化器取代 AdamW 用于绑定嵌入模型,节省内存
研究人员开发了 AF-Muon,一种无需在绑定嵌入模型中使用 AdamW 的优化器,可能节省约 20% 的优化器状态内存。这种新方法在隐藏权重矩阵上保持了 Muon 的谱范数最陡下降更新,同时为绑定词汇表采用了支持感知线性最小化。AF-Muon 在包括语言模型、图像模型和蛋白质序列在内的各种模型架构和数据模态中,以最小的开销展示了平均验证损失和困惑度的稳健改进。
-
新研究探索 LLM 的自适应和最小化提示工程
三篇新研究论文探讨了优化大型语言模型 (LLM) 所用提示的方法。第一篇论文介绍了 AdaGEPA,一种自适应反馈分配技术,旨在通过针对提示性能中的特定弱点来改进提示修订。另外两篇论文提出了提示最小化框架,旨在通过识别和移除冗余组件来减少少样本提示的长度,同时保持输出保真度。这些最小化技术可以降低计算开销和延迟,并可能提高 LLM 的推理能力和准确性。
-
新AI模型LAVOIR学会提问
研究人员开发了LAVOIR,这是一种新颖的决策编码器,旨在改进AI系统提出澄清性问题的方式。与以往猜测信息缺失的模型不同,LAVOIR能够识别并优先考虑最有价值的问题。该系统将信息价值(VOI)直接整合到其决策过程中,从而以更少的问题实现更高的准确性。在研究中,LAVOIR在已见模式上取得了与理论最大值统计上无法区分的结果,并在真实对话中显著提高了准确性。
-
Temperon训练方法以更低成本实现SAM质量
研究人员推出了一种新颖的训练方法Temperon,旨在以显著降低的计算成本实现Sharpness-Aware Minimization (SAM) 的质量。Temperon采用两阶段方法:初始探索阶段使用标准SGD,然后在训练后期切换到SAM包装的Muon精炼器。该方法在CIFAR-10/100和Tiny ImageNet等各种数据集上已证明具有与全时SAM相当的准确性,并能更快地达到目标准确率。该方法在预训练GPT-2和针对GLUE…
-
函数缩放定律下探索最优学习率调度
本文探讨了机器学习模型最优学习率调度,特别是在函数缩放定律(FSL)框架下。文章确定了一个基于任务难度和模型容量的关键过渡点,该点决定了早期幂衰减还是预热-稳定-衰减调度更有效。研究还表明,精确的衰减形状调整可能不如之前认为的那么关键,分数调度可以达到最优收敛率。
-
新算法解决线性回归中的自选择偏差
研究人员开发了一种新的算法,用于估计具有自选择偏差的线性回归量,改进了现有方法。该算法通过引入首个针对自选择的局部收敛方法,实现了更快的运行时间,解决了该领域的一个关键开放性问题。该方法将自选择问题简化为在粗化(coarsening)下的统计估计,在这种情况下,只能观察到包含真实值的集合。这种处理了与先前工作不同的非凸分区的方法,利用了自选择问题的几何特性来克服分析限制,并可能在其他潜在变量问题中找到应用。
-
新的批量SGD方法提供高概率收敛保证
研究人员推出了一种新颖的随机梯度下降(SGD)变体——批量SGD,旨在为优化问题实现高概率收敛保证。该方法将在线样本划分为多个周期(epochs),每个周期使用一个精炼的梯度估计进行一次更新。该方法通过避免严格的假设和辅助序列来简化分析,为强凸和非凸目标都提供了近乎最优的收敛速率。此外,批量SGD还扩展到联邦学习领域,为该领域提供了首个具有对数通信复杂度和对数据异质性韧性的高概率保证。