PulseAugur
实时 04:27:27
实体 SGD

SGD

PulseAugur coverage of SGD — every cluster mentioning SGD across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
20
90 天内 118
发布 · 30天
0
90 天内 0
论文 · 30天
19
90 天内 115
层级分布 · 90 天
主题
关系
情绪 · 30 天

12 天有情绪数据

最近 · 第 1/6 页 · 共 118 条
  1. TOOL · CL_213838 ·

    BuyWhere MCP 工具实现跨境购物价格标准化

    BuyWhere 推出了多币种价格 (MCP) 工具,旨在通过标准化不同市场和货币的价格来增强购物代理。该工具允许代理准确比较来自新加坡 (SGD)、日本 (日元) 和美国 (USD) 等不同地区的商品价格,确保提醒基于相关且最新的信息。该系统帮助代理过滤掉过时的商品列表,并为用户提供更清晰的工作流程,防止因不准确的价格比较而产生的通知疲劳。

  2. TOOL · CL_212876 ·

    研究发现误差反馈会损害Adam优化器的性能

    一项最新研究表明,在机器学习中用于缓解精度损失的技术——误差反馈,与Adam优化器结合使用时表现不佳。虽然误差反馈对随机梯度下降(SGD)有效,但与Adam结合使用时,与纯量化或不量化相比,收敛效果明显更差。研究表明,Adam的非线性特性(与SGD的线性特性不同)导致了这种有害的相互作用,使得结果距离最优值近乎两倍之遥。

  3. TOOL · CL_212080 ·

    新的DeltaMomentum优化器加速深度学习训练

    研究人员推出了一种新颖的深度学习优化器动量更新方法——DeltaMomentum。与使用固定指数移动平均率的传统方法不同,DeltaMomentum根据特定方向梯度更新的频率动态调整遗忘率。这种受线性层梯度结构启发的基于键值对的方法旨在更有效地清除陈旧方向并提高训练速度。实验表明,DeltaMomentum的实现版本DeltaAdamW在包括大型语言模型和图像分类任务在内的各种模型规模和数据集上,与标准的AdamW相比,在显著更少的步…

  4. TOOL · CL_208478 ·

    新研究将 Transformer 优化问题与梯度异质性联系起来

    一篇新研究论文探讨了 Transformer 模型在优化方面的挑战,特别是在微调场景下。该研究发现,梯度异质性(参数块之间梯度范数的变异)是导致标准基于梯度的优化方法(如 SGD)收敛困难的关键因素之一,与 Hessian 异质性共同作用。研究表明,自适应优化器(如 Adam)和基于符号的方法(如 SignSGD)对这种异质性不太敏感。论文还指出,层归一化的放置(Post-LN 架构表现出特别明显的异质性)对该问题有显著影响。实验验证…

  5. RESEARCH · CL_206036 ·

    新研究探讨分数优化器和Adam的原理

    两篇新研究论文探讨了神经网络优化技术的进展。第一篇论文研究了分数优化器与分形激活函数之间的相互作用,发现某些组合可以改善神经网络训练,特别是在使用特定分形激活函数的正则化风格分数缩放时。第二篇论文通过分析Adam(一种广泛使用的优化器)的收敛特性及其在Transformer上的有效性,为其提供了原则性的基础。这项研究还介绍了Adam-mini,一种在保持性能的同时将Adam内存占用减半的优化器,并对Muon等其他优化器提供了见解。

  6. RESEARCH · CL_193841 ·

    新研究为神经网络训练提供理论收敛保证

    两篇新研究论文探讨了神经网络训练的理论基础。第一篇论文通过引入广义 Lipschitz 光滑性条件,为通用前馈神经网络中的梯度下降建立了收敛保证。第二篇论文提出了一种深度神经网络训练的统一优化框架,通过 Legendre 函数和共轭变换推广了凸性和光滑性,并引入了具有理论收敛率的广义梯度下降和 SGD。

  7. TOOL · CL_193815 ·

    AI训练效率:梯度优化方法基准测试

    一篇新的研究论文在受限硬件上对五种梯度优化器和三种内存策略进行了AI训练基准测试。研究发现,梯度累积是在不同架构上降低训练损失最有效的策略,而梯度检查点的性能高度依赖于架构。与普遍假设相反,Adam并非普遍优越,在某些情况下Adadelta和SGD的表现优于它。该研究为选择优化器和梯度策略以提高AI模型训练和部署的资源效率提供了实用指导。

  8. TOOL · CL_193232 ·

    新框架支持复杂AI算法的在线统计推断

    研究人员开发了一种新颖的在线统计推断框架,用于利用马尔可夫数据的非线性随机逼近算法。该框架为部分和路径建立了函数中心极限定理,无需估计渐近方差即可创建自归一化置信区间。所提出的方法采用五维多项式级数归一化器,展示了接近标称的覆盖率,并与在线bootstrap方法相比降低了计算成本。其应用包括Q学习、具有马尔可夫数据的广义线性模型以及低秩自适应(LoRA)的推断。

  9. TOOL · CL_204326 ·

    新研究对内存高效的AI训练梯度优化器进行基准测试

    一项新研究针对四种Transformer架构,对五种梯度优化器(SGD、Adam、Adagrad、Adadelta和共轭梯度下降)与三种节省内存的策略(标准训练、梯度检查点和梯度累积)进行了基准测试。研究发现,梯度累积是在不增加GPU内存使用量的情况下降低训练损失最有效的策略。研究还显示,Adam并非总是最优的优化器,在某些架构中,Adadelta和SGD的表现优于它,而梯度检查点的有效性高度依赖于具体的模型架构。

  10. RESEARCH · CL_185428 ·

    新研究探讨MUON优化器的收敛性并提出MALT扩展

    两篇新研究论文探讨了MUON优化算法,这是一种用于训练大型语言模型的方法。第一篇论文介绍了MALT,它是MUON的一个扩展,通过轻量级的对角预处理来提高对损失曲面曲率各向异性的鲁棒性。MALT旨在保持MUON的效率,同时提高其性能,这在GPT-2模型的实验中得到了证明。第二篇论文分析了MUON的收敛特性,表明它可能无法收敛于某些随机优化问题,并对该算法的广义变体进行了误差分析。

  11. TOOL · CL_183384 ·

    新研究概述了SGD预处理器的设计,以实现稳定性和降噪

    一篇新发表在arXiv上的研究论文详细介绍了随机梯度下降(SGD)预处理器的设计标准,重点关注局部条件、噪声底和盆地稳定性。该论文推导了收敛速率和噪声底受对称正定矩阵M影响的界限。对于非凸目标,它建立了依赖于预处理器的盆地稳定性保证,这对于科学机器学习(SciML)应用尤其重要,因为在这些应用中物理保真度和数值稳定性至关重要。在诊断和SciML基准测试上的实验验证了所提出的通过选择M来改善局部条件并降低噪声的设计原则。

  12. TOOL · CL_180635 ·

    研究论文详述线性回归模型中的“良性拟合不良”现象

    一篇新的研究论文探讨了线性回归模型中“良性拟合不良”的现象,即在训练数据上表现不佳的模型仍然可以很好地泛化到新的、未见过的数据。这种情况发生在一个特定的区域,其中训练集的大小远大于维度数量,但小于直接插值所需的数量。研究表明,即使在经验训练误差很高的情况下,诸如随机梯度下降(SGD)之类的方法也可以在此预测的“第四象限”中实现较低的测试误差。

  13. RESEARCH · CL_183002 ·

    新框架提供超越单位激励的随机鞍点规避

    一篇新的研究论文介绍了一种用于随机鞍点规避的路径李亚普诺夫-珀龙框架,超越了传统的单位激励假设。该框架解决了噪声在接近平稳点时减弱或存在于低维子空间中的情况,这在过参数化模型和有限和问题中很常见。所提出的方法利用了路径相关的变量替换和路径李亚普诺夫-珀龙策略,以证明几乎确定地规避了严格鞍点,从而实现了随机镜面下降(包括SGD)和近端型随机梯度方法等方法的局部最小值收敛。

  14. TOOL · CL_178385 ·

    新的CAP-TTA框架增强了LLM在叙事生成中的去偏能力

    研究人员开发了CAP-TTA,一个新颖的测试时自适应框架,旨在提高大型语言模型(LLMs)在遇到分布外、高偏见提示时的去偏能力。该框架利用由偏见风险分数触发的上下文感知LoRA更新,并采用预计算的对角线预条件子以实现快速稳定的优化。与AdamW或SGD等标准方法相比,CAP-TTA以更低的延迟有效减少了毒性和偏见,同时还增强了叙事流畅性并防止了灾难性遗忘。

  15. TOOL · CL_167607 ·

    新研究将 mini-batch 噪声与 SGD 中的损失景观尖锐度联系起来

    一篇新的研究论文提出,在随机梯度下降(SGD)训练过程中,mini-batch 噪声通过引起主子空间内的波动来影响损失景观的尖锐度。作者认为,这个主子空间通常由 Hessian 的顶级特征向量定义,对于理解尖锐度动态比直接降低损失更重要。他们的工作推导出了与这些主方向上的 mini-batch 噪声相关的尖锐度校正项,实验表明,将此项纳入梯度下降的尖锐度演变使其更接近 SGD 的演变。

  16. TOOL · CL_167135 ·

    Seesaw方法通过优化批次大小和学习率调度来加速LLM训练

    研究人员开发了一种名为Seesaw的新方法,通过优化批次大小和学习率的调度来加速大型语言模型的训练。该方法在理论上证明了SGD的学习率衰减与批次大小增长之间的等价性,并将其扩展到Adam的代理。实证表明,Seesaw在FLOPs方面与余弦衰减相当,同时将Chinchilla规模模型的训练时间缩短了约36%。

  17. TOOL · CL_167104 ·

    AI 辅助解决 SS--RS--GD 不等式

    一篇新发表在 arXiv 上的论文解决了 SS--RS--GD 不等式,这是 COLT 2021 关于单次洗牌 SGD、随机重排 SGD 和梯度下降算子的一项猜想。研究表明 SS-RS 不等式不成立,并为 n=3 提供了具体的反例。然而,RS-GD 不等式被证明对于定义范围内的对称矩阵是成立的。论文指出,GPT-5.5 Pro 被用于辅助证明。

  18. TOOL · CL_165155 ·

    新技术使用模型曲率改进 DP-SGD 的准确性

    研究人员开发了一种名为 NoiseCurve 的新技术,以提高差分隐私随机梯度下降 (DP-SGD) 的准确性。该方法利用从无标签数据估计出的模型曲率,来增强不同训练迭代中隐私噪声的相关性。实验表明,在各种数据集和模型上,NoiseCurve 相比现有的 DP-MF 相关方案提供了持续的准确性改进。

  19. TOOL · CL_160616 ·

    权重绑定的 Transformer:递归作为一种算法

    一篇新的研究论文探讨了权重绑定的循环 Transformer 的收敛特性,研究了这些架构何时能有效地实现算法。该研究提出了四个关键发现:一个“预算定律”,其中训练预算决定计算速度;一个有利于串行处理而非并行扫描的架构先验;对复杂性墙的重新评估,表明 NC1-完备性成本低廉而群阶计算成本高昂;以及通过预热学习机制的可移植性。研究人员还开发了一种新的测量工具,收敛时间缩放 tau(n,i),以预测分布外性能。

  20. TOOL · CL_158953 ·

    哈佛研究人员揭示预测 LLM 预训练动态的简单二次模型

    哈佛大学的研究人员开发了一个简单的二次模型,可以准确预测大型语言模型在预训练过程中的优化动态。通过将泰勒定理应用于真实的神经网络检查点,他们发现展开式中的高阶项在关键的预训练窗口内贡献很小,这表明潜在的动态本质上是二次的。这个简化的模型为确定最佳停止时间、批次大小和学习率等核心预训练挑战提供了精确的见解,有效地揭示了预训练过程的本质。