PulseAugur
实时 06:58:35
实体 Adam

Adam

PulseAugur coverage of Adam — every cluster mentioning Adam across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
33
90 天内 133
发布 · 30天
0
90 天内 0
论文 · 30天
31
90 天内 119
层级分布 · 90 天
主题
关系
情绪 · 30 天

16 天有情绪数据

最近 · 第 1/7 页 · 共 133 条
  1. TOOL · CL_215954 ·

    Adam优化器的边缘稳定性现象在新研究中得到分析

    研究人员对Adam优化器中的边缘稳定性(EoS)现象进行了理论分析,重点关注一个简化的二维二次问题。他们的工作通过证明在许多参数范围内存在趋向于稳定性阈值的趋势,为Adam的EoS提供了动力学解释。然而,该研究也确定了特定的条件,例如某些周期性轨道和调整后的轨迹,即使在收敛到最优值时,这种边缘搜索机制也会失效。

  2. TOOL · CL_212876 ·

    研究发现误差反馈会损害Adam优化器的性能

    一项最新研究表明,在机器学习中用于缓解精度损失的技术——误差反馈,与Adam优化器结合使用时表现不佳。虽然误差反馈对随机梯度下降(SGD)有效,但与Adam结合使用时,与纯量化或不量化相比,收敛效果明显更差。研究表明,Adam的非线性特性(与SGD的线性特性不同)导致了这种有害的相互作用,使得结果距离最优值近乎两倍之遥。

  3. RESEARCH · CL_212318 ·

    新的 arXiv 论文探讨神经网络计算与学习之间的断开

    两篇新的 arXiv 论文探讨了神经计算的动力学,重点关注复杂的前向计算与更简单的学习机制之间的分歧。第一篇论文引入了一个“生成-事实图”来统一训练、学习和推理,并展示了一个使用 nanoGPT 和 ResNet 在保留运行中具有高准确率的预测模型。第二篇论文识别出一种“前向-后向断开”,指出虽然神经网络中的前向计算已高度多样化,但学习方法在很大程度上仍围绕反向传播及其变体。两篇论文都表明需要更好地协调这些方面,以实现更具生物学基础和…

  4. TOOL · CL_208478 ·

    新研究将 Transformer 优化问题与梯度异质性联系起来

    一篇新研究论文探讨了 Transformer 模型在优化方面的挑战,特别是在微调场景下。该研究发现,梯度异质性(参数块之间梯度范数的变异)是导致标准基于梯度的优化方法(如 SGD)收敛困难的关键因素之一,与 Hessian 异质性共同作用。研究表明,自适应优化器(如 Adam)和基于符号的方法(如 SignSGD)对这种异质性不太敏感。论文还指出,层归一化的放置(Post-LN 架构表现出特别明显的异质性)对该问题有显著影响。实验验证…

  5. TOOL · CL_206539 ·

    新的Adam启发方法显示出凸目标函数的加速收敛性

    研究人员开发了受Adam优化器启发的新确定性方法,旨在提高平滑凸目标函数的收敛速度。这些方法,Adam-HNAG和Adam-HNAG-s,利用变量-算子分裂技术来解耦动量和自适应预处理。通过引入Hessian驱动的校正和Adam风格的梯度反馈,新算法在特定条件下展示了离散Lyapunov收缩,从而实现了O(k^-2)的目标值界限。数值实验表明,与原始Adam递归相比,这些方法提供了改进的性能。

  6. TOOL · CL_206516 ·

    新的MVN-Grad优化器提高了深度学习的稳定性和性能

    研究人员推出了一种新颖的优化算法MVN-Grad,旨在提高深度学习模型的稳定性和性能。该方法将基于方差的归一化与归一化后的动量相结合,旨在缓解Adam等标准优化器中存在的梯度尖峰和跨时间耦合等问题。在CIFAR-100图像分类和GPT风格语言建模等任务上,MVN-Grad与现有优化器相比,在计算开销仅略微增加的情况下,实现了具有竞争力的或更优的结果,提供了更平稳的训练和更好的泛化能力。

  7. TOOL · CL_206396 ·

    新研究探讨 Adam 优化器的内存如何减缓进展

    一篇新研究论文介绍了《Coordinatewise Adam 中的二阶矩记忆》,探讨了 Adam 优化器中内存的影响。研究表明,即使具有有限方差的随机梯度,优化器对过去平方梯度的记忆也会阻碍其向最优解的进展。该论文推导了一个理论界限,表明更长的二阶矩记忆会减缓优化速度,尤其是在光滑凸问题中。

  8. TOOL · CL_206358 ·

    研究论文质疑神经网络中grokking转变机制

    一篇新的研究论文探讨了神经网络中“grokking”现象,即模型最初表现不佳,但在记忆了训练数据后,其泛化能力会迅速提高。该研究调查了这种急剧转变是否由插值流形的正常双曲性丧失引起,这是动力学系统中的一个概念。研究人员使用基于残差雅可比矩阵的最小非零奇异值的诊断工具,发现该值在转变过程中并未崩溃,这表明泛化能力的提高可能是一个平滑的漂移,而不是一个分岔事件。

  9. TOOL · CL_206184 ·

    Palmyra x6 LLM 首次亮相,具备代理能力和强劲的基准性能

    一份新的技术报告详细介绍了 Palmyra x6,这是一个专为代理任务设计的大型语言模型。该模型使用锚定监督微调(Anchored Supervised Fine-Tuning)在精心策划的合成工具使用轨迹集上开发,并采用了混合优化方法。在 Writer Agent 方面,Palmyra x6 相较于之前的模型有了显著改进,并在 BFCL Core 等基准测试中取得了最高分,性能优于几款近期模型。

  10. RESEARCH · CL_206036 ·

    新研究探讨分数优化器和Adam的原理

    两篇新研究论文探讨了神经网络优化技术的进展。第一篇论文研究了分数优化器与分形激活函数之间的相互作用,发现某些组合可以改善神经网络训练,特别是在使用特定分形激活函数的正则化风格分数缩放时。第二篇论文通过分析Adam(一种广泛使用的优化器)的收敛特性及其在Transformer上的有效性,为其提供了原则性的基础。这项研究还介绍了Adam-mini,一种在保持性能的同时将Adam内存占用减半的优化器,并对Muon等其他优化器提供了见解。

  11. RESEARCH · CL_206401 ·

    新的“纤维指纹”揭示隐藏的AI模型状态

    研究人员引入了“纤维指纹”来形式化学习系统如何表现出隐藏的内部状态,这些状态在当前行为上无法区分,但会影响未来的训练响应。该框架使用当前行为等价类中的受控未来学习响应定律。对Qwen2.5-7B和Mistral-7B-v0.3等模型的研究,采用Transformer++和LoRA+等技术,揭示了当前行为不足以预测未来的学习,突显了训练历史和隐藏时刻差异所产生的区别。

  12. RESEARCH · CL_195827 ·

    新论文质疑神经网络概念维度测量方法

    一篇新论文探讨了神经网络表示中的“概念维度”概念,质疑了常用的测量方法。研究人员证明,迭代擦除计数(常用于量化神经网络编码信息的方向数量)可以通过可逆重参数化进行操纵。这表明这些计数不是概念的内在属性,而是取决于所使用的特定测量过程。该研究以 V-JEPA2 特征为例,说明了即使底层预测问题相同,不同的优化过程也会产生不同的结果。

  13. TOOL · CL_193867 ·

    经典 SU(2) 模型在视觉任务上优于量子电路

    一篇新的研究论文在各种视觉基准测试上比较了经典 SU(2) 模型与变分量子电路 (VQC)。研究发现,四元数神经网络(一种经典 SU(2) 模型)在 MNIST、Fashion-MNIST 和 CIFAR-10 等数据集上的表现与浅层 VQC 相当或更好。虽然四元数网络保持了很高的实值网络性能百分比,但 VQC 显示出较低的准确率和较高的计算成本,这表明对于缺乏内在量子结构的任务,经典 SU(2) 几何可以作为浅层量子电路的有效替代方案。

  14. TOOL · CL_193815 ·

    AI训练效率:梯度优化方法基准测试

    一篇新的研究论文在受限硬件上对五种梯度优化器和三种内存策略进行了AI训练基准测试。研究发现,梯度累积是在不同架构上降低训练损失最有效的策略,而梯度检查点的性能高度依赖于架构。与普遍假设相反,Adam并非普遍优越,在某些情况下Adadelta和SGD的表现优于它。该研究为选择优化器和梯度策略以提高AI模型训练和部署的资源效率提供了实用指导。

  15. TOOL · CL_193636 ·

    新的动态增益缩放方法可减小持续学习中的稳定性差距

    研究人员引入了一种新颖的动态增益缩放机制来解决持续学习中的稳定性差距问题。该方法受大脑神经调质爆发的启发,旨在通过暂时增加更新幅度并重新参数化权重来平衡任务转换期间的可塑性和稳定性。在 MNIST、CIFAR 和 mini-ImageNet 基准测试上的实验表明,该技术在不损害准确性的情况下有效减小了稳定性差距,增强了转换期间的鲁棒性。

  16. TOOL · CL_193449 ·

    新的黑盒攻击针对DeepSeek-OCR,揭示了解码器故障

    研究人员开发了一种新颖的黑盒对抗性攻击,针对生成式OCR视觉语言模型DeepSeek-OCR。该攻击仅基于解码后的字符串输出进行操作,无需访问模型内部的梯度或logits等信息。该方法将攻击视为一个零阶优化问题,使用随机方向有限差分方案来估计梯度,并使用带有ell_infinity投影的Adam优化器来实现不可感知的图像扰动。对DeepSeek-OCR的初步实验揭示了显著的定性解码器故障,包括重复、截断和提示泄露,尽管有针对性的重写更具挑战性。

  17. TOOL · CL_204326 ·

    新研究对内存高效的AI训练梯度优化器进行基准测试

    一项新研究针对四种Transformer架构,对五种梯度优化器(SGD、Adam、Adagrad、Adadelta和共轭梯度下降)与三种节省内存的策略(标准训练、梯度检查点和梯度累积)进行了基准测试。研究发现,梯度累积是在不增加GPU内存使用量的情况下降低训练损失最有效的策略。研究还显示,Adam并非总是最优的优化器,在某些架构中,Adadelta和SGD的表现优于它,而梯度检查点的有效性高度依赖于具体的模型架构。

  18. TOOL · CL_188743 ·

    LoRA技术大幅削减大型语言模型微调成本

    LoRA(Low-Rank Adaptation,低秩适应)是一种显著降低大型语言模型微调计算成本的技术。LoRA冻结原始权重,并学习一个低秩更新矩阵,而不是训练所有模型权重。这种方法大大减少了优化器和梯度所需的内存,使得在消费级GPU上微调大型模型成为可能。该方法由Hu等人的一篇论文详细介绍,其依据是观察到微调期间的模型更新通常本质上是低秩的。

  19. TOOL · CL_202775 ·

    四元数网络在视觉任务上表现优于量子电路

    研究人员将四元数神经网络与浅层变分量子电路(VQC)在经典监督学习任务上的性能进行了比较。研究发现,在MNIST、Fashion-MNIST和CIFAR-10等基准测试中,四元数网络的性能普遍能媲美或接近实值神经网络的性能。相比之下,浅层VQC的准确率较低,计算成本较高,这表明共享的局部SU(2)几何结构不足以在这些场景中带来实际的量子优势。

  20. TOOL · CL_187184 ·

    FlowAdam 优化器通过 ODE 集成和软动量注入增强训练

    研究人员开发了 FlowAdam,这是一种新颖的优化器,通过普通微分方程 (ODE) 集成连续梯度流,从而增强了 Adam 优化器。这种混合方法旨在提高耦合参数任务的性能,例如矩阵分解和图神经网络,在这些任务中,标准 Adam 由于其逐坐标缩放而可能难以处理。FlowAdam 包含一种“软动量注入”机制,在模式转换期间将 ODE 速度与 Adam 的动量相结合,从而防止训练崩溃并提供隐式正则化。实验表明,FlowAdam 在特定基准测…