PulseAugur
中
实时 08:50:59
实体 muon

muon

PulseAugur coverage of muon — every cluster mentioning muon across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
143
90 天内 143
发布 · 30天
0
90 天内 0
论文 · 30天
134
90 天内 134
层级分布 · 90 天
主题
关系
情绪 · 30 天

12 天有情绪数据

LAB BRAIN
hypothesis resolved contradicted 置信度 0.60

Aurora optimizer may outperform Muown in addressing Muon's neuron death

Tilde Research's Aurora optimizer is specifically designed to fix 'neuron death' in Muon, a problem not explicitly addressed by Muown. While Muown improves spectral norm drift, Aurora's targeted approach to neuron inactivity could lead to more comprehensive performance gains, especially in scenarios where neuron death is a primary bottleneck.

observation resolved contradicted 置信度 0.85

Muon optimizer's spectral norm drift is a key area for improvement

Multiple recent papers (Muown, Pion, and the general mode connectivity research) highlight issues related to spectral norms and Muon. Muown explicitly addresses 'upward drift of spectral norms', while Pion aims to 'preserve spectrum'. This suggests that managing spectral properties is a critical challenge for Muon's stability and performance.

observation resolved confirmed 置信度 0.75

Spectrum preservation is a common theme in new optimizer research

The introduction of Pion, which 'preserves spectrum', and Muown, which addresses 'spectral norm drift', indicates a broader trend in optimizer development. This focus on maintaining spectral properties suggests that current optimizers, including Muon, may suffer from spectral instability that hinders training.

observation resolved confirmed 置信度 0.80

Muon's spectral properties are being actively studied in relation to optimizer behavior and mode connectivity

Multiple recent clusters highlight research into Muon's spectral properties and how they interact with optimization dynamics. The connection between optimizers, spectral norms, and mode connectivity suggests ongoing theoretical and empirical work is exploring fundamental aspects of Muon's behavior.

hypothesis resolved contradicted 置信度 0.70

Muon's neuron death issue may be addressed by new optimizers like Aurora within 3 months

The Tilde Research launch of Aurora specifically targets neuron death in Muon. Given Aurora's public release and demonstrated effectiveness, it's plausible that Muon users will adopt Aurora or similar solutions to mitigate this issue within the next quarter.

查看全部假设 →

最近 · 第 1/8 页 · 共 147 条
  1. TOOL · CL_289346 ·

    行归一化在高维分类中优于 Adam 和 Muon

    一篇新的研究论文探讨了机器学习中优化器的几何特性,提出在हरूको维多类别分类任务中,行归一化可以优于 Adam 和 Muon。研究表明,与 Adam 的逐坐标几何和 Muon 的谱几何相比,行归一化的逐类欧几里得几何能更好地保持决策边界方向,从而避免失真。这一优势在包括各向同性高斯云数据和幂律谱在内的各种数据模型下得到了证明,并且通过合成和语言模型实验支持了这些发现。

  2. TOOL · CL_286901 ·

    研究:最佳AI优化器随批量大小而变化,挑战定标规则

    一项新的研究论文挑战了这样一种传统观念:训练语言模型的最佳优化器在不同批量大小下保持一致。该研究表明,'Muon'优化器没有单一的定标规则能在各种训练条件下始终表现良好。此外,研究表明,即使经过彻底的超参数调整,预训练语言模型的最佳优化器也会随着批量大小的调整而发生显著变化。

  3. TOOL · CL_284768 ·

    LionMuon 优化器通过混合方法降低 LLM 预训练成本

    研究人员开发了 LionMuon,这是一种旨在降低预训练大型语言模型的高昂计算成本的新型优化器。LionMuon 在计算成本高昂的谱步(类似于 Muon)和成本较低的符号步(类似于 Lion)之间交替进行。这种混合方法利用共享的动量缓冲区,旨在与现有的优化器(如 AdamW、Lion 和 Signum)相比,以更少的训练时间和更小的内存占用实现更低的损失。在 FineWeb 上训练的模型进行的实验证明了 LionMuon 在达到更低损…

  4. TOOL · CL_284278 ·

    Muon 优化器谱整形分析揭示低维度的益处

    研究人员调查了细粒度谱整形对于 Muon 优化器的必要性,该优化器使用矩阵动量结合当前和过去的梯度。通过谱诊断,他们发现大部分奇异模式位于估计的噪声边缘之下,但集体上与参考梯度呈正相关。该研究引入了 BulkBoost,一个双频带谱重加权框架,该框架在与现有方法竞争的同时,通过降低最终损失而优于 Muon 的标准平坦配置文件。

  5. TOOL · CL_280224 ·

    新的OptiSelect框架优化了LLM预训练的数据选择

    研究人员推出OptiSelect,一个用于优化大型语言模型预训练期间数据选择的新框架。该框架将优化器感知选择的概念形式化,该概念考虑了优化器步骤如何影响数据候选者的价值。理论分析表明,与Lion和Muon等基于符号或极性切线的预条件器相比,AdamW和Sophia等对角自适应优化器在此选择过程中更有效。使用124M和720M模型的实验结果支持了这些发现,表明即使使用Muon作为优化器,AdamW的评分几何形状也表现最佳。

  6. TOOL · CL_275203 ·

    SoftServe:新的拟牛顿法应对深度学习挑战

    研究人员开发了SoftServe,一种新颖的拟牛顿(QN)方法系列,旨在解决深度学习中非凸性和海量参数规模的挑战。与传统的QN方法不同,SoftServe即使在负曲率区域也能获得正定曲率估计,并通过对角线和Kronecker分解变体扩展到大型神经网络。该方法利用耦合牛顿-舒尔茨迭代进行矩阵运算,用GPU友好的矩阵乘法取代了昂贵的分解。SoftServe在病态问题上表现出优越的性能,包括物理信息神经网络和扩散模型,实现了比Adam和Mu…

  7. RESEARCH · CL_268749 ·

    AF-Muon 优化器取代 AdamW 用于绑定嵌入模型,节省内存

    研究人员开发了 AF-Muon,一种无需在绑定嵌入模型中使用 AdamW 的优化器,可能节省约 20% 的优化器状态内存。这种新方法在隐藏权重矩阵上保持了 Muon 的谱范数最陡下降更新,同时为绑定词汇表采用了支持感知线性最小化。AF-Muon 在包括语言模型、图像模型和蛋白质序列在内的各种模型架构和数据模态中,以最小的开销展示了平均验证损失和困惑度的稳健改进。

  8. TOOL · CL_259396 ·

    新的无导数框架使 Muon 能够进行无梯度优化

    研究人员开发了一个无导数框架,用于将 Muon 优化方法改编到梯度不可用或不可靠的场景。这种新方法使用结构化有限差分来构建类似 Muon 的更新,提供了四种变体,包括随机低秩代理和直接结构化搜索。在矩阵回归和有噪声梯度任务上的实验表明,结构化探测可以显著减少所需函数评估的次数,有可能在特定黑盒问题中弥补不可靠的梯度预言机。

  9. TOOL · CL_259344 ·

    Temperon训练方法以更低成本实现SAM质量

    研究人员推出了一种新颖的训练方法Temperon,旨在以显著降低的计算成本实现Sharpness-Aware Minimization (SAM) 的质量。Temperon采用两阶段方法:初始探索阶段使用标准SGD,然后在训练后期切换到SAM包装的Muon精炼器。该方法在CIFAR-10/100和Tiny ImageNet等各种数据集上已证明具有与全时SAM相当的准确性,并能更快地达到目标准确率。该方法在预训练GPT-2和针对GLUE…

  10. TOOL · CL_258951 ·

    新方法为AI正则化逆问题提供认证的提前停止

    研究人员开发了一种用于正则化逆问题中认证提前停止的方法,该方法涉及数据保真项与正则化项之间的权衡。该方法利用精确对偶间隙恒等式将总间隙分解为数据保真项和正则化项。该方法提供了可计算的误差界限和一个无预言机的间隙,该间隙限制了次优性,并基于容差阈值提供了一个提前停止规则。该框架应用于广义Beurling-Lasso,并将Lion-K和Muon等深度学习优化器认证为正则化程序的求解器。

  11. TOOL · CL_257105 ·

    新的优化方法MAGD在LLM预训练方面展现出潜力

    研究人员发现Muon优化方法存在局限性,该方法专为机器学习中的矩阵值参数设计。虽然Muon对动量矩阵进行正交化,但即使采用自适应步长,它也可能无法收敛到凸Lipschitz目标的全局最优值。该研究提出了MAGD,一种结合了正交动量和梯度加权的替代方法,在包括LLM预训练在内的实验中提供了改进的收敛速度和实际性能。

  12. TOOL · CL_255981 ·

    7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆

    来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。

  13. TOOL · CL_254183 ·

    在 150M 参数以下模型中,更深、更窄的模型优于更宽的模型

    研究人员探索了 1.5 亿以下参数模型中模型深度与宽度的影响,发现在使用相同的训练方法和数据的情况下,更深、更窄的架构(23 层 x 576 隐藏层)优于更宽、更浅的架构(53.5M vs 110M 参数)。较大的 110M 参数模型在 BLiMP 和 ARC-Easy 等基准测试中取得了更好的结果,且训练 token 更少,这表明在此参数范围内,深度比规模更关键。使用值残差和 Muon 优化器的进一步实验在 ARC-Easy 基准测…

  14. TOOL · CL_254034 ·

    7名博士生利用数百个AI代理从零开始训练7B大语言模型

    北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。

  15. TOOL · CL_252051 ·

    新的 ISO-LoRA 优化器提升了 LLM 参数高效适应性

    研究人员推出了一种新颖的优化技术 ISO-LoRA,旨在提高低秩适应(LoRA)在大语言模型上的效率。与仅关注参数预算秩的传统 LoRA 方法不同,ISO-LoRA 考虑了优化器如何影响秩的利用。通过 GPT-2 实验观察到,AdamW 等优化器通常会导致有效秩较低的更新,而一种名为 Muon 的新优化器则利用了更多方向。ISO-LoRA 通过对权重空间中诱导的切线扰动应用谱下降来耦合 LoRA 因子更新,从而在奇异方向上更均匀地分配…

  16. TOOL · CL_247779 ·

    新的Musec优化器增强了LLM训练稳定性

    研究人员推出了一种新颖的优化器MomentUm SpEctral Clipping (Musec),旨在稳定大型语言模型的训练。Musec解决了μ子优化器固有的不稳定性问题,该优化器通常优于Adam和AdamW,但可能出现损失尖峰和权重无界增长。与需要架构修改的先前方法不同,Musec实现了一种优化器级别的谱裁剪机制,该机制保留了动量矩阵的谱结构。该论文还详细介绍了一种名为Soft Musec的高效实现,它为非凸、非光滑随机优化提供了…

  17. RESEARCH · CL_254129 ·

    开源ZGCM-1模型在数学和智能体搜索方面实现高效率

    研究人员推出ZGCM-1,一个为数学推理和智能体搜索设计的7B参数基础模型。该模型利用了一种高效的训练方法,结合了交错注意力等架构创新、稳定的FP8 Muon优化器以及渐进式课程学习。ZGCM-1在特定任务上展现出与更大规模前沿模型相媲美的性能,并在训练时间上提供了显著的效率提升。

  18. TOOL · CL_245095 ·

    新研究解释了优化器为何在等变网络上表现不佳

    研究人员确定了某些优化器(如 Muon)在训练等变神经网络时优于 Adam 的一个关键原因。问题源于 Adam 在等变线性层的不同块之间处理学习率的方式。具体来说,Adam 会单独重新缩放权重,而不考虑这些块的边界,从而导致步长不一致。提出的解决方案包括单独对每个块的更新进行归一化,并结合调整后的动量系数,这使得 Adam 在各种数据集上能够与 Muon 相媲美。

  19. TOOL · CL_245057 ·

    新的二次谱下降法提高了GPT预训练效率

    研究人员开发了一种名为二次谱下降法(QSD)的新优化方法,该方法改进了用于训练大型语言模型的现有Muon算法。QSD将局部曲率信息纳入优化过程,可以改变最优更新的奇异值和方向。通过使用Kronecker因子统计量近似曲率并采用Frank-Wolfe方法,QSD变得实用。在GPT预训练上的实验表明,与Muon及其变体相比,QSD持续降低了验证损失,并将训练时间缩短了高达8.49%,同时达到了匹配的验证损失。

  20. TOOL · CL_244942 ·

    新的FedSubMuon方法大幅降低LLM联邦微调的通信成本

    研究人员开发了FedSubMuon,一种用于大型语言模型(LLM)联邦微调的新颖方法,可显著降低通信成本。该方法优化了共享结构化子空间内的紧凑系数矩阵,从而在保持矩阵感知优化的优势的同时实现高效更新。一个扩展版本FedSubMuon-GT通过使用投影梯度自适应跟踪的子空间基,进一步提高了准确性。实验表明,FedSubMuon-GT在多个数据集-模型对上取得了卓越的准确性,而FedSubMuon在各种通信预算下提供了最佳性能,大幅超越了基线。