AdamW
PulseAugur coverage of AdamW — every cluster mentioning AdamW across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
新的DeltaMomentum优化器加速深度学习训练
研究人员推出了一种新颖的深度学习优化器动量更新方法——DeltaMomentum。与使用固定指数移动平均率的传统方法不同,DeltaMomentum根据特定方向梯度更新的频率动态调整遗忘率。这种受线性层梯度结构启发的基于键值对的方法旨在更有效地清除陈旧方向并提高训练速度。实验表明,DeltaMomentum的实现版本DeltaAdamW在包括大型语言模型和图像分类任务在内的各种模型规模和数据集上,与标准的AdamW相比,在显著更少的步…
-
新研究论文分析 AdamW 优化器的内存效应
研究人员开发了一种方法来分析 AdamW 优化器中小批量扰动的延迟效应。通过将 AdamW 建模为有限时域输入-状态-输出系统,他们可以将局部梯度变化映射到其对训练损失的未来影响。这种方法揭示了优化器的内存如何影响这些效应的大小、时间和符号,从而提供了一种分解误差和近似未来影响的方法。
-
LionMuon 优化器提供高效的大规模模型训练
研究人员推出 LionMuon,这是一种新颖的优化器,专为高效的大规模机器学习模型训练而设计。这种新方法在 Lion 和 Muon 的更新步骤之间交替进行,利用共享的动量缓冲区来降低计算成本,同时保持强大的方向准确性。实验表明,LionMuon 在各种数据集和模型大小上均优于 Muon、Lion、Signum 和 AdamW 等现有优化器,以更少的计算量实现了更低的验证损失。
-
量子 NLP 模型在 SPSA 超参数调优方面遇到困难
一篇新的 arXiv 论文探讨了变分量子自然语言推理 (VQ-NLI) 模型的超参数调优。研究调查了同步扰动随机逼近 (SPSA) 相较于参数移位梯度法的有效性。尽管 AdamW 风格的 SPSA 取得了一些改进,但由于其梯度估计的高方差,尤其是在参数量较大的模型中,其性能仍落后于参数移位基线。
-
新的“纤维指纹”揭示隐藏的AI模型状态
研究人员引入了“纤维指纹”来形式化学习系统如何表现出隐藏的内部状态,这些状态在当前行为上无法区分,但会影响未来的训练响应。该框架使用当前行为等价类中的受控未来学习响应定律。对Qwen2.5-7B和Mistral-7B-v0.3等模型的研究,采用Transformer++和LoRA+等技术,揭示了当前行为不足以预测未来的学习,突显了训练历史和隐藏时刻差异所产生的区别。
-
Muon训练的Transformer出现后涌现崩溃,失去泛化能力
一篇新研究论文探讨了在用Muon优化器训练的Transformer中一种被称为“后涌现崩溃”的现象。虽然Muon最初在模块化加法任务上表现出更快的学习速度,但模型最终会失去泛化能力。这种失败发生在模型内部表示与其输出层之间的接口处,在特定条件下,Muon优化器和AdamW嵌入的行为不同。研究表明,当模型中与任务对齐的组件被隔离时,可以恢复性能,这表明崩溃并非由于根本性的表示退化,而是表示-读出接口处的问题。
-
新的 SG-TULA 算法为复杂的 AI 模型提供了改进的采样
研究人员开发了次梯度驯服无调整 Langevin 算法 (SG-TULA),这是一种用于从复杂分布中采样的创新方法,这些分布是不可微、非凸的,并且具有超线性梯度增长。该算法直接在次梯度上运行,避免了计算密集型的平滑过程,并与现有的基于次梯度的 Langevin 算法相比,在 Wasserstein-2 距离上提供了改进的非渐近收敛界限。SG-TULA 已被证明能够有竞争力地预训练 GPT-2 系列的 LLM,表现与微调的 AdamW …
-
新研究探讨MUON优化器的收敛性并提出MALT扩展
两篇新研究论文探讨了MUON优化算法,这是一种用于训练大型语言模型的方法。第一篇论文介绍了MALT,它是MUON的一个扩展,通过轻量级的对角预处理来提高对损失曲面曲率各向异性的鲁棒性。MALT旨在保持MUON的效率,同时提高其性能,这在GPT-2模型的实验中得到了证明。第二篇论文分析了MUON的收敛特性,表明它可能无法收敛于某些随机优化问题,并对该算法的广义变体进行了误差分析。
-
新的 MESH 优化器提高了 MoE 训练效率,降低了内存使用
研究人员开发了 MESH,这是一种新颖的优化技术,旨在提高混合专家(MoE)模型训练的效率。传统的内存高效优化器(如 Sinkhorn)由于 MoE 架构的梯度具有条件性和可变性,因此在 MoE 架构上存在困难。MESH 引入了一种隐藏动量 Sinkhorn 更新,可保留时间一阶矩信号,与 AdamW 相比,优化器状态内存减少约 62.5%,峰值 PyTorch CUDA 分配减少约 12.6%,同时保持具有竞争力的评估损失。
-
Muon 优化器在 Mamba-2 130M 上显示出代币效率提升
一篇新的研究论文探讨了 Muon 优化器的有效性,该优化器使用牛顿-舒尔茨迭代法在谱范数下进行最速下降,应用于状态空间模型。该研究将 Muon 与 AdamW 在 Mamba-2 130M 模型上进行了比较,发现仅将 Muon 应用于输出投影就能带来最显著的代币效率提升。这种优势在不同的语料库和训练时长中都得到了观察,并且不能用输入投影的条件改进来解释。
-
新的AOS-R系统通过切换优化器来优化深度学习训练
研究人员开发了AOS-R,一种新颖的自适应优化器切换系统,旨在提高深度网络训练效率和泛化能力。该系统监控六个在线梯度空间信号,根据不断变化的优化景观动态地在AdamW、SGD-M和Lion等优化器之间切换。在WRN-28x10模型在CIFAR-100上的测试中,AOS-R与单独的优化器相比,在更少的epoch内实现了更高的准确率,并在多个基准测试中展示了更高的准确率和更快的收敛速度。
-
新的 nGPT 训练方法将 MoE 模型所需的 token 数量减半
研究人员开发了一种名为归一化 Transformer (nGPT) 的新训练方法,该方法将模型参数和激活限制在单位超球面上,以改进表示学习。这一方法在最近的 arXiv 论文中进行了详细介绍,包括 Logit Gradient Preconditioning、Logarithmic Learning Rate Decay 和 GatedAdamW 等技术。当应用于混合 Mamba-2--Transformer Mixture-of-E…
-
新研究揭示高熵模型比AdamW更能抵抗灾难性遗忘
一篇题为“被理解的幻觉:真正的平衡缓解了灾难性遗忘”的新研究论文探讨了神经网络表示在标准泛化指标之外的鲁棒性。研究发现,使用Wang-Landau分子动力学技术(该技术采样高熵解)优化的模型,比使用AdamW训练的模型更能抵抗灾难性遗忘。在旨在测试知识保留的噪声注入实验中,高熵模型在其原始任务上保持了约95%的准确率,而AdamW训练的模型准确率下降到75%以下。这表明,虽然两种模型在训练集和测试集上可能达到相似的性能,但高熵模型拥有…
-
新的CAP-TTA框架增强了LLM在叙事生成中的去偏能力
研究人员开发了CAP-TTA,一个新颖的测试时自适应框架,旨在提高大型语言模型(LLMs)在遇到分布外、高偏见提示时的去偏能力。该框架利用由偏见风险分数触发的上下文感知LoRA更新,并采用预计算的对角线预条件子以实现快速稳定的优化。与AdamW或SGD等标准方法相比,CAP-TTA以更低的延迟有效减少了毒性和偏见,同时还增强了叙事流畅性并防止了灾难性遗忘。
-
AI模型利用迁移学习准确评估痤疮严重程度
研究人员开发了一个四类痤疮严重程度分类器,该分类器使用EfficientNet-B0模型进行迁移学习,并在ACNE04数据集上进行了微调。该模型在测试集上达到了93.5%的准确率和94.4%的宏观F1分数,大多数错误发生在相邻等级之间。Grad-CAM可视化突出了临床相关的面部区域,并且该流程已作为开源实现提供Python和MATLAB版本。
-
Muon 优化器在理论和实践神经网络训练中展现出潜力
两篇新的研究论文探讨了 Muon 优化器,这是一种旨在更好地处理神经网络中矩阵结构参数的方法。第一篇论文介绍了一种用于 Sharpness-Aware Minimization (SAM) 的矩阵感知几何,将谱内扰动与 Muon 结合,以提高 ImageNet-1K 上的鲁棒性和验证准确性。第二篇论文对 Muon 进行了理论收敛性分析,证明了它通过利用神经网络训练中 Hessian 矩阵的低秩结构,有潜力超越传统的梯度下降。
-
Transformer优化新见解:识别出隐藏边界运动
研究人员在Transformer优化中识别出一种称为“隐藏边界运动”的现象,其中权重和偏差更新对于具有非零均值输入的仿射层在函数上是无法区分的。这种运动主要通过权重矩阵更新而非显式偏差更新来实现,对优化有显著影响。开发了一种名为SBO-AdamW的新型优化器来解决这个问题,在IMDb数据集的验证准确率上有所提高,但仍需要进一步工作才能实现稳定、通用的解决方案。
-
NVIDIA 研究表明 AdamW 优化器存在规模上限
NVIDIA 研究人员发布了新发现,表明 AdamW 优化器可能存在规模上限。他们的工作表明,在用于预测下一个 token 的批量大小高达 1000 万个 token 时,SOAP 和 Muon 等优化器能够保持训练稳定性和质量,而 AdamW 则会下降。研究人员通过正交化和预条件处理解决了 SOAP 在大批量情况下的不稳定性问题,证明了在训练数万亿 token 的数十亿参数模型时,Muon 和 SOAP 的表现始终优于 AdamW。…
-
新型优化器CvAdamW加速神经网络“领悟”
研究人员推出了一种新颖的AdamW优化器变体CvAdamW,旨在加速神经网络中的“领悟”(grokking)现象。领悟是指模型在记忆训练数据后实现泛化。通过将Transformer注意力视为一个热力学系统并监测其比热(Cv),CvAdamW能够动态调整权重衰减,在泛化转换即将发生时进行干预。该方法在模块化算术任务上,比标准训练显著更早地实现了领悟,在某些实验中平均领悟延迟减少了250多个epoch。研究结果表明,神经网络可能存在可检测…
-
研究发现 Muon 优化器的 Grokking 速度归因于正交化
一篇新发表在 arXiv 上的研究论文详细介绍了 Muon 优化器在模运算中比 AdamW 更快的 Grokking 阈值背后的活性成分。该研究将正交化,特别是牛顿-舒尔茨迭代,确定为导致这种加速的关键机制。减少牛顿-舒尔茨迭代次数可以加速 Grokking,但会导致解决方案不稳定,而五次迭代被证明是各种学习率下最稳健的选择。