AdamW
PulseAugur coverage of AdamW — every cluster mentioning AdamW across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
LionMuon 优化器通过混合方法降低 LLM 预训练成本
研究人员开发了 LionMuon,这是一种旨在降低预训练大型语言模型的高昂计算成本的新型优化器。LionMuon 在计算成本高昂的谱步(类似于 Muon)和成本较低的符号步(类似于 Lion)之间交替进行。这种混合方法利用共享的动量缓冲区,旨在与现有的优化器(如 AdamW、Lion 和 Signum)相比,以更少的训练时间和更小的内存占用实现更低的损失。在 FineWeb 上训练的模型进行的实验证明了 LionMuon 在达到更低损…
-
新的OptiSelect框架优化了LLM预训练的数据选择
研究人员推出OptiSelect,一个用于优化大型语言模型预训练期间数据选择的新框架。该框架将优化器感知选择的概念形式化,该概念考虑了优化器步骤如何影响数据候选者的价值。理论分析表明,与Lion和Muon等基于符号或极性切线的预条件器相比,AdamW和Sophia等对角自适应优化器在此选择过程中更有效。使用124M和720M模型的实验结果支持了这些发现,表明即使使用Muon作为优化器,AdamW的评分几何形状也表现最佳。
-
新研究揭示混合Transformer-SSM模型中的学习率迁移
一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。
-
新的 ISO-AdamW 优化器显示出比标准 AdamW 略有优势
一种名为 ISO-AdamW 的新优化器被测试了其在训练大型语言模型方面的有效性,并与标准的 AdamW 进行了比较。虽然 ISO-AdamW 显示出轻微的改进,在 1000 道数学题考试中取得了 758 个正确答案,而 AdamW 取得了 754 个,但这种微小的增益不足以证明在生产系统中取代已有的 AdamW 优化器是合理的。该实验在 NVIDIA H200 GPU 上进行了受控设置,重点关注了等谱性(isospectrality…
-
AI开发者分享监督数据;新优化器显示微小收益 · 跟踪3个来源
Agent开发者开始分享监督指标,Anthropic报告了其AI性能的具体数字。另外,一种名为ISO-AdamW的新优化技术在GSM8K基准测试上显示出比AdamW略有改进,尽管它使用了更多的GPU内存。此外,一位用户表达了对研究论文密集段落快速解释的需求,暗示了对能够总结复杂信息的AI工具的需求。
-
研究发现,Transformer中的大规模激活遵循可预测的生命周期
研究人员详细介绍了Transformer模型中大规模激活的生命周期,这些激活是大规模残差流与注意力汇聚点相关联的坐标。研究表明,这些携带汇聚点的通道在训练早期就会稳定下来,并随着时间的推移整合到少数冗余的载体上。一个关键的发现是,权重衰减在因果关系上调节了这些激活的总体规模,移除权重衰减会允许持续增长,而保留权重衰减则会导致下降。该研究提出了一个平衡模型,其中AdamW预处理的增长与权重衰减相对抗,影响峰值激活的时间和幅度。
-
新研究探索具有刚体力学和权重分析的 Transformer 架构 · 跟踪 5 个来源
研究人员正在探索通过整合刚体力学和分析权重结构来增强 Transformer 架构的新方法。一篇论文介绍了“Screw Attention”,这是一种 Transformer 层,它使用刚体代数对物体之间的空间关系进行建模,在操作任务和几何变化鲁棒性方面表现出改进的性能。另一项研究“JET: Justification Evaluation in Transformer”专注于提高 Transformer 在 MMLU 等任务中的决策…
-
新的 PEFT 方法 GPart 和 GDLoRA 旨在匹配全量微调的性能
两篇新的研究论文介绍了用于大型语言模型参数高效微调 (PEFT) 的新颖方法,旨在缩小与全量微调的性能差距。第一篇论文 GPart 提出了一种使用全局参数分区的端到端等距微调方法,该方法将可训练参数直接映射到具有固定几何形状的权重空间。第二篇论文 GDLoRA 将全量权重梯度分解以提取“法向梯度”分量,然后使用该分量直接更新基准权重,以补充标准的 LoRA 优化。这两种方法在各种基准测试中,在显着更低的参数预算下,均展示了与现有 PE…
-
AF-Muon 优化器取代 AdamW 用于绑定嵌入模型,节省内存
研究人员开发了 AF-Muon,一种无需在绑定嵌入模型中使用 AdamW 的优化器,可能节省约 20% 的优化器状态内存。这种新方法在隐藏权重矩阵上保持了 Muon 的谱范数最陡下降更新,同时为绑定词汇表采用了支持感知线性最小化。AF-Muon 在包括语言模型、图像模型和蛋白质序列在内的各种模型架构和数据模态中,以最小的开销展示了平均验证损失和困惑度的稳健改进。
-
7名博士生利用数百个AI代理从零开始训练7B大语言模型
北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。
-
新理论解释神经网络优化器动力学中的重尾谱出现
研究人员开发了一种新方法来理解神经网络权重矩阵中重尾谱密度的出现方式,这是隐式自正则化的指标。他们将这种出现表述为一个命中时间问题,考虑了在观察期内未达到重尾诊断的运行。他们的发现提出了一个维度修正的谱隙定律,该定律得到了包括 Qwen2.5-0.5B 和 Pythia-70M 在内的各种模型以及理论分析的经验数据的支持。
-
新的 ISO-LoRA 优化器提升了 LLM 参数高效适应性
研究人员推出了一种新颖的优化技术 ISO-LoRA,旨在提高低秩适应(LoRA)在大语言模型上的效率。与仅关注参数预算秩的传统 LoRA 方法不同,ISO-LoRA 考虑了优化器如何影响秩的利用。通过 GPT-2 实验观察到,AdamW 等优化器通常会导致有效秩较低的更新,而一种名为 Muon 的新优化器则利用了更多方向。ISO-LoRA 通过对权重空间中诱导的切线扰动应用谱下降来耦合 LoRA 因子更新,从而在奇异方向上更均匀地分配…
-
新方法解决了长上下文专家混合模型训练中的内存峰值问题
研究人员开发了四种新颖的技术来解决训练具有长上下文的专家混合(MoE)模型时的内存限制。这些方法,包括 PipelinedLLEP、Ring-DTP、Selective Checkpoint Offload (SCO) 和 OffloadStreamAdamW,针对专家调度、词汇投影、梯度检查点和优化器状态等特定内存瓶颈。通过改变计算和数据移动的顺序而非计算本身,这些技术可以保持精确的梯度和损失。当结合使用时,它们能够以一百万个 to…
-
新的Musec优化器增强了LLM训练稳定性
研究人员推出了一种新颖的优化器MomentUm SpEctral Clipping (Musec),旨在稳定大型语言模型的训练。Musec解决了μ子优化器固有的不稳定性问题,该优化器通常优于Adam和AdamW,但可能出现损失尖峰和权重无界增长。与需要架构修改的先前方法不同,Musec实现了一种优化器级别的谱裁剪机制,该机制保留了动量矩阵的谱结构。该论文还详细介绍了一种名为Soft Musec的高效实现,它为非凸、非光滑随机优化提供了…
-
新研究优化LoRA模型微调 · 2篇论文
两篇新研究论文探讨了低秩自适应(LoRA)微调的优化方法。第一篇论文研究了LoRA秩、模型质量和计算成本之间的权衡,发现中等秩(4-8)对扩散模型而言效率最高。第二篇论文介绍了一种自适应各向异性学习率(AnLR-LoRA)方法,为LoRA适配器内的每个秩一分量分配单独的学习率,通过更好地利用秩容量,在各种基准测试中提高了性能。
-
AI训练基础:梯度下降与AdamW详解
《Towards AI》的两篇文章深入探讨了机器学习训练的基础概念。第一篇文章解释了梯度在训练大型模型时的局限性,强调了像AdamW这样的优化器的必要性。第二篇文章探讨了梯度下降背后的直觉,揭示了机器学习模型如何通过数学过程进行学习。
-
新研究表明优化器性能随训练范围变化
一篇新研究论文探讨了在训练范围和参数数量增加时,不同优化器的性能表现。研究发现,像 Muon、SOAP、ADANA 和 AdamW 这样的优化器的最佳超参数和相对性能会随着训练的延长而显著改变。具体来说,首选的学习率调度可能会逆转,权重衰减系数会随着超训练因子的平方根进行缩放。ADANA 在超训练水平较高时,尤其是在采用对数时间权重衰减和动量冷却的情况下,显示出比 AdamW 持续的缩放优势,并与 SOAP 竞争。在大多数测试范围内,…
-
新的CAHR-Net模型提供了紧凑且可解释的磁芯损耗建模
研究人员开发了CAHR-Net,一种用于建模磁芯损耗的新型网络。该模型将频率、温度和波形形状等运行条件独特地整合到滞后重构过程中,与现有方法相比,提供了更具可解释性和更紧凑的方法。CAHR-Net在MagNet数据集上实现了6.89%的低平均p95相对误差,并且参数数量远少于其他领先模型。
-
SGD 动力学被建模为渗透过程,并扩展到 Adam 和 AdamW
研究人员将随机梯度下降 (SGD) 的动力学建模为渗透过程,揭示了架构对称性如何导致子网络以离散块的形式合并。这些转变会导致方差激增,类似于物理相变。该研究进一步证明,当 Adam 和 AdamW 等优化算法受到重尾噪声影响时,这种捕获机制及其尺度级联也适用于它们。
-
研究揭示 Qwen3 和 Llama 模型最优微调策略
一项新研究探讨了大型语言模型监督微调(SFT)的最优超参数,研究了学习率、批次大小和优化器选择等因素。该研究系统地测试了不同模型家族(包括 Qwen3 和 Llama)以及各种 SFT 数据集上的这些变量。主要发现涉及最优设置如何随模型大小和数据量进行扩展,LoRA 与全量微调之间的权衡,以及训练后收益的有效性。