muon
PulseAugur coverage of muon — every cluster mentioning muon across labs, papers, and developer communities, ranked by signal.
- developed by alphaXiv 90%
- developed by ScienceCast 90%
- developed alphaXiv 90%
- developed Gotit.pub 90%
- developed CatalyzeX 90%
- instance of Shampoo 90%
- developed Newton-Schulz 90%
- developed Shampoo 90%
- used by GPT-2 small 90%
- instance of Vít 90%
- used by large language model 80%
- competes with DagsHub 80%
18 天有情绪数据
Aurora optimizer may outperform Muown in addressing Muon's neuron death
Tilde Research's Aurora optimizer is specifically designed to fix 'neuron death' in Muon, a problem not explicitly addressed by Muown. While Muown improves spectral norm drift, Aurora's targeted approach to neuron inactivity could lead to more comprehensive performance gains, especially in scenarios where neuron death is a primary bottleneck.
Muon optimizer's spectral norm drift is a key area for improvement
Multiple recent papers (Muown, Pion, and the general mode connectivity research) highlight issues related to spectral norms and Muon. Muown explicitly addresses 'upward drift of spectral norms', while Pion aims to 'preserve spectrum'. This suggests that managing spectral properties is a critical challenge for Muon's stability and performance.
Spectrum preservation is a common theme in new optimizer research
The introduction of Pion, which 'preserves spectrum', and Muown, which addresses 'spectral norm drift', indicates a broader trend in optimizer development. This focus on maintaining spectral properties suggests that current optimizers, including Muon, may suffer from spectral instability that hinders training.
Muon's spectral properties are being actively studied in relation to optimizer behavior and mode connectivity
Multiple recent clusters highlight research into Muon's spectral properties and how they interact with optimization dynamics. The connection between optimizers, spectral norms, and mode connectivity suggests ongoing theoretical and empirical work is exploring fundamental aspects of Muon's behavior.
Muon's neuron death issue may be addressed by new optimizers like Aurora within 3 months
The Tilde Research launch of Aurora specifically targets neuron death in Muon. Given Aurora's public release and demonstrated effectiveness, it's plausible that Muon users will adopt Aurora or similar solutions to mitigate this issue within the next quarter.
-
新的RODE优化器解耦神经网络训练动态
研究人员推出RODE,一种用于神经网络的新型优化引擎,它将矩阵更新的径向和方向分量解耦。这种分离允许不同的更新规则和步长,从而实现更有效和可控的训练。在GPT-2上的实验证明了在范数控制和方向更新方面的改进,而在语言建模和图像分类任务上的比较显示RODE的性能优于Muon变体,实现了更低的损失和最终的全局范数。
-
新型优化器提升扩散Transformer训练效率
研究人员开发了一种名为周期性逐行Muon(Periodic Row-wise Muon)的新优化技术,以提高扩散Transformer(DiTs)的训练效率。该方法基于原始Muon优化器,通过减少完全谱更新的频率,并对剩余步骤使用计算效率更高的逐行更新。协同设计的分布式实现通过直接操作分片动量并使计算与通信重叠来进一步提高速度。新技术在保持生成质量不变或略有提高的同时,显著减少了优化器时间、步长时间和通信量,从而提高了训练大型DiTs的效率。
-
新的DeltaMomentum优化器加速深度学习训练
研究人员推出了一种新颖的深度学习优化器动量更新方法——DeltaMomentum。与使用固定指数移动平均率的传统方法不同,DeltaMomentum根据特定方向梯度更新的频率动态调整遗忘率。这种受线性层梯度结构启发的基于键值对的方法旨在更有效地清除陈旧方向并提高训练速度。实验表明,DeltaMomentum的实现版本DeltaAdamW在包括大型语言模型和图像分类任务在内的各种模型规模和数据集上,与标准的AdamW相比,在显著更少的步…
-
面向大型MoE模型的计算高效超参数迁移
研究人员开发了一个计算高效的框架,用于确定大型混合专家(MoE)模型中的最优学习率。这个两步过程包括在不同宽度的模型之间迁移最优学习率,然后推断到海量token预算。通过在小型代理模型上进行线性回归,该方法可以准确预测长达10万亿token的训练视野的理想学习率,显著降低了计算成本。该框架成功应用于预训练一个1550亿参数的基础模型,验证了其有效性。
-
LionMuon 优化器提供高效的大规模模型训练
研究人员推出 LionMuon,这是一种新颖的优化器,专为高效的大规模机器学习模型训练而设计。这种新方法在 Lion 和 Muon 的更新步骤之间交替进行,利用共享的动量缓冲区来降低计算成本,同时保持强大的方向准确性。实验表明,LionMuon 在各种数据集和模型大小上均优于 Muon、Lion、Signum 和 AdamW 等现有优化器,以更少的计算量实现了更低的验证损失。
-
Palmyra x6 LLM 首次亮相,具备代理能力和强劲的基准性能
一份新的技术报告详细介绍了 Palmyra x6,这是一个专为代理任务设计的大型语言模型。该模型使用锚定监督微调(Anchored Supervised Fine-Tuning)在精心策划的合成工具使用轨迹集上开发,并采用了混合优化方法。在 Writer Agent 方面,Palmyra x6 相较于之前的模型有了显著改进,并在 BFCL Core 等基准测试中取得了最高分,性能优于几款近期模型。
-
新的谱显著性遗忘方法增强了AI模型中的数据移除能力
研究人员推出了一种新颖的机器学习遗忘方法——谱显著性遗忘(SSU),该方法基于一种称为Muon的梯度下降变体。SSU通过识别和更新仅由可靠遗忘信号支持的方向来移除特定训练数据的影响,有效地阈值化了弱奇异分量。该方法在理论上得到了其对遗忘-保留权衡影响的证明,并在图像分类器、扩散模型和大型语言模型等各种模型上证明了其有效性。
-
新研究探讨分数优化器和Adam的原理
两篇新研究论文探讨了神经网络优化技术的进展。第一篇论文研究了分数优化器与分形激活函数之间的相互作用,发现某些组合可以改善神经网络训练,特别是在使用特定分形激活函数的正则化风格分数缩放时。第二篇论文通过分析Adam(一种广泛使用的优化器)的收敛特性及其在Transformer上的有效性,为其提供了原则性的基础。这项研究还介绍了Adam-mini,一种在保持性能的同时将Adam内存占用减半的优化器,并对Muon等其他优化器提供了见解。
-
UniDot架构统一推荐模型,在KDD Cup 2026中获得亚军
研究人员开发了UniDot,一种用于点击后转化预测的新型架构,它统一了特征交互和序列建模。通过将非序列特征和行为序列分词到一个共享空间,UniDot能够通过单一的点积来处理推荐的这两个方面。该模型在TAAC KDD Cup 2026的工业赛道中获得亚军。
-
新的sMuon方法增强了神经网络的低秩微调
研究人员开发了一种名为sMuon的新方法,以改进神经网络的参数高效微调(PEFT)。该技术通过在低秩设置中近似Muon目标,解决了Muon优化器与常见的LoRA PEFT方法之间的不兼容问题。该实现仅使用矩阵乘法运算,并在监督微调和ReLoRA预训练实验中显示出有利的结果,提供了适度的性能改进。
-
新的FedCoMuon优化器增强了分布式矩阵式模型优化
研究人员推出了一种新颖的联邦组合式优化器FedCoMuon,旨在解决分布式矩阵式组合优化问题。该新方法基于组合梯度跟踪和正交化动量。还提出了一种方差缩减变体FedCoMuon-VR,与现有的FedMuon算法相比,它在找到ε-平稳解方面实现了O(ε−3)的较低样本复杂度。在联邦学习和风险敏感元学习中的实验表明,FedCoMuon和FedCoMuon-VR具有竞争力,并在某些场景下实现了卓越的准确性。
-
Dion3优化器将AI训练时间缩短高达6倍
研究人员开发了Dion3,这是Muon优化器的一个优化版本,旨在减少计算和通信开销。新的Gram Newton-Schulz算法,以及CuTeDSL内核和兆批处理策略,显著加快了正交化过程。Dion3在实现与Muon相当或更好的性能的同时,将优化器步进时间缩短了高达六倍,并且可以作为即插即用型替代品使用。
-
Dion3 优化 Muon 优化器,实现 6 倍加速
研究人员开发了 Dion3,这是 Muon 优化器的一个优化版本,可显著降低计算和通信开销。通过实现诸如 Gram Newton-Schulz 算法、使用 CuTeDSL 进行内核级增强以及仅选择动量矩阵一部分的更新规则等算法改进,Dion3 在保持或提高性能的同时,优化器步进时间最多可减少 6 倍。Dion3 的代码可作为 Muon 的即插即用替代品。
-
新的 GO-MUON 方法改进了谱几何以进行优化
研究人员推出了一种新颖的优化方法 GO-MUON,该方法通过采用匹配的数据依赖几何来提高 μ 子极更新的准确性。该方法可以精确地求解加权谱预言器,而与几何映射的估计或刷新方式无关。该研究还分析了反向因子对 softmax 交叉熵的 Fisher 和广义 Gauss-Newton 因子的近似,并探讨了四步刷新过程的权衡。
-
Muon训练的Transformer出现后涌现崩溃,失去泛化能力
一篇新研究论文探讨了在用Muon优化器训练的Transformer中一种被称为“后涌现崩溃”的现象。虽然Muon最初在模块化加法任务上表现出更快的学习速度,但模型最终会失去泛化能力。这种失败发生在模型内部表示与其输出层之间的接口处,在特定条件下,Muon优化器和AdamW嵌入的行为不同。研究表明,当模型中与任务对齐的组件被隔离时,可以恢复性能,这表明崩溃并非由于根本性的表示退化,而是表示-读出接口处的问题。
-
新的Skewon算法在Stiefel流形上提供精确的闭式优化
研究人员开发了Skewon,这是一种用于处理具有正交列的矩阵问题的新的优化算法,这是机器学习中的常见结构。该算法为Stiefel流形上的Muon优化方法提供了精确的闭式解,克服了先前近似或迭代方法的局限性。Skewon还为平滑的非凸优化任务提供了高阶收敛保证,并且有高效的实现可用。
-
新的 SG-TULA 算法为复杂的 AI 模型提供了改进的采样
研究人员开发了次梯度驯服无调整 Langevin 算法 (SG-TULA),这是一种用于从复杂分布中采样的创新方法,这些分布是不可微、非凸的,并且具有超线性梯度增长。该算法直接在次梯度上运行,避免了计算密集型的平滑过程,并与现有的基于次梯度的 Langevin 算法相比,在 Wasserstein-2 距离上提供了改进的非渐近收敛界限。SG-TULA 已被证明能够有竞争力地预训练 GPT-2 系列的 LLM,表现与微调的 AdamW …
-
Kimi K3 采用 896 个专家和混合注意力机制实现高效扩展
Kimi K3 是一个拥有 2.8 万亿参数的模型,它采用了一种新颖的方法来管理其庞大的规模,即每个 token 只激活 896 个路由专家中的 16 个。研究员苏剑林详细介绍了这一策略,旨在控制计算成本,尽管参数量和上下文长度有所增加。该模型集成了 LatentMoE 以减少专家计算和通信,并结合了 RMSNorm 和 SiTU-GLU 等机制,以在低精度训练期间保持数值稳定性。其注意力架构结合了 KDA 用于连续状态维护和 MLA…
-
Adam优化器在因子模型中与梯度下降不同
一篇新的研究论文探讨了Adam和梯度下降等优化算法在应用于因子模型时行为的差异。研究表明,虽然梯度下降由于损失函数的规范对称性而隐式地偏向于低秩解,但Adam和类似的逐坐标优化器不具备这种偏向。这种差异归因于规范等变性,它对于从梯度流转移性质是必需的,但不足以恢复低秩。该研究根据恢复误差对九种更新规则进行了排序,发现Adam在Transformer中分离了规范等价的初始化,导致每个头的逆变器存在显著差异。
-
新研究探讨MUON优化器的收敛性并提出MALT扩展
两篇新研究论文探讨了MUON优化算法,这是一种用于训练大型语言模型的方法。第一篇论文介绍了MALT,它是MUON的一个扩展,通过轻量级的对角预处理来提高对损失曲面曲率各向异性的鲁棒性。MALT旨在保持MUON的效率,同时提高其性能,这在GPT-2模型的实验中得到了证明。第二篇论文分析了MUON的收敛特性,表明它可能无法收敛于某些随机优化问题,并对该算法的广义变体进行了误差分析。