PulseAugur
实时 00:00:33
实体 Muon optimizer

Muon optimizer

PulseAugur coverage of Muon optimizer — every cluster mentioning Muon optimizer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_128586 ·

    谱梯度下降通过缓解失配来增强 AI 模型训练

    一篇新论文介绍了一种名为谱梯度下降(SpecGD)的优化方法,该方法通过保留方向信息而丢弃尺度来增强深度学习性能。研究使用非线性相位恢复模型分析了 SpecGD 的有效性,该模型等同于训练一个两层神经网络。研究表明,SpecGD 缓解了由各向异性输入引起的失配问题,而各向异性输入会通过放大无信息方差方向来阻碍标准梯度下降。与传统的梯度下降相比,这可以实现更稳定的对齐和更快的降噪。

  2. SIGNIFICANT · CL_100080 ·

    DeepSeek发布V4模型,支持1M上下文和MoE架构

    DeepSeek发布了其DeepSeek-V4系列混合专家(MoE)语言模型的预览版,包括DeepSeek-V4-Pro(1.6T参数)和DeepSeek-V4-Flash(284B参数)。这两个模型都支持前所未有的百万级token上下文长度,这得益于混合注意力架构和优化的残差连接方法。这些模型在超过32万亿token上进行训练,在长上下文场景中展现出显著的效率提升,与前代模型相比,DeepSeek-V4-Pro在推理时所需的FLOP…

  3. RESEARCH · CL_39993 ·

    新的 Muon 优化器变体提高了 LLM 训练效率和性能

    多篇研究论文探讨了 Muon 优化器在训练大型语言模型和其他深度学习架构方面的进展和应用。MONA 将 Nesterov 加速引入 Muon,以提高收敛速度和下游任务性能,并在大型模型上取得了最先进的成果。MuCon 研究了对 Muon 更新进行裁剪,以在不进行完整奇异值分解的情况下近似其行为。另一项研究考察了 Muon 在对抗性训练中的有效性,表明在各种威胁模型和架构上,它可以与 SGD 和 AdamW 等标准优化器竞争或超越它们。…

  4. FRONTIER RELEASE · CL_47594 ·

    Qwen发布27B多模态模型,用于高级编码

    Qwen发布了Qwen3.6-27B,这是一款为高级编码任务设计的、参数量为270亿的密集多模态模型。该模型旨在提供旗舰级的智能体编码性能,超越了该类别中先前的开源模型。社区成员已在Hugging Face上提供了Qwen3.6-27B的各种量化版本,方便其在不同平台和库中使用。