PulseAugur
实时 07:01:25

Muon 优化器在理论和实践神经网络训练中展现出潜力

两篇新的研究论文探讨了 Muon 优化器,这是一种旨在更好地处理神经网络中矩阵结构参数的方法。第一篇论文介绍了一种用于 Sharpness-Aware Minimization (SAM) 的矩阵感知几何,将谱内扰动与 Muon 结合,以提高 ImageNet-1K 上的鲁棒性和验证准确性。第二篇论文对 Muon 进行了理论收敛性分析,证明了它通过利用神经网络训练中 Hessian 矩阵的低秩结构,有潜力超越传统的梯度下降。 AI

影响 Muon 优化器的理论和经验优势可能带来更高效、更鲁棒的神经网络训练。

排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了一种新的神经网络优化方法。

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

Muon 优化器在理论和实践神经网络训练中展现出潜力

报道来源 [2]

  1. arXiv stat.ML TIER_1 English(EN) · Wenzhi Zhong, Edward Milsom, Michael Murray ·

    锐度感知最小化与μ子:谱范数下的鲁棒性

    arXiv:2607.26001v1 Announce Type: cross Abstract: Sharpness-Aware Minimization (SAM) aims to improve generalization by encouraging insensitivity to small, worst-case parameter perturbations. However, the notion of a "small" perturbation is inherently geometry-dependent: while exi…

  2. arXiv stat.ML TIER_1 English(EN) · Wei Shen, Ruichuan Huang, Minhui Huang, Cong Shen, Jiawei Zhang ·

    关于μ子收敛性分析

    arXiv:2505.23737v3 Announce Type: replace Abstract: The majority of parameters in neural networks are naturally represented as matrices. However, most commonly used optimizers treat these matrix parameters as flattened vectors during optimization, potentially overlooking their in…