Muon optimizer
PulseAugur coverage of Muon optimizer — every cluster mentioning Muon optimizer across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
LLaDA-Image 设定了图像生成领域新的开源SOTA
研究人员推出 LLaDA-Image,一个使用从头开始训练的 6B Diffusion Transformer 生成高质量图像的新颖框架。该模型利用纯图像预训练和专用优化器来实现照片级真实感结果和精确编辑能力。一个蒸馏版本 LLaDA-Image-Turbo 支持快速推理。LLaDA-Image 在 Qwen-Image-Bench 上设定了开源模型中的新最先进水平(SOTA),其权重、代码和训练方法已公开发布,以促进进一步研究。
-
中国AI实验室独立研发相似前沿模型,大幅降低成本
两家中国AI实验室,Z.ai和阿里巴巴,已分别独立开发并发布了新的大型语言模型GLM-5.3-Flash和Qwen3.8-Flash-Next。这两个模型共享一个非常相似的架构,其特点是混合注意力机制,包含高比例的线性注意力层和压缩索引器,以高效管理长上下文窗口。这些架构上的趋同使得两个模型都能提供显著降低的计算成本和更快的推理速度,使先进的AI能力更加易于获取和负担得起,输入令牌价格约为每百万个0.15美元。
-
阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…
-
谱梯度下降通过缓解失配来增强 AI 模型训练
一篇新论文介绍了一种名为谱梯度下降(SpecGD)的优化方法,该方法通过保留方向信息而丢弃尺度来增强深度学习性能。研究使用非线性相位恢复模型分析了 SpecGD 的有效性,该模型等同于训练一个两层神经网络。研究表明,SpecGD 缓解了由各向异性输入引起的失配问题,而各向异性输入会通过放大无信息方差方向来阻碍标准梯度下降。与传统的梯度下降相比,这可以实现更稳定的对齐和更快的降噪。
-
DeepSeek发布V4模型,支持1M上下文和MoE架构
DeepSeek发布了其DeepSeek-V4系列混合专家(MoE)语言模型的预览版,包括DeepSeek-V4-Pro(1.6T参数)和DeepSeek-V4-Flash(284B参数)。这两个模型都支持前所未有的百万级token上下文长度,这得益于混合注意力架构和优化的残差连接方法。这些模型在超过32万亿token上进行训练,在长上下文场景中展现出显著的效率提升,与前代模型相比,DeepSeek-V4-Pro在推理时所需的FLOP…
-
新的 Muon 优化器变体提高了 LLM 训练效率和性能
多篇研究论文探讨了 Muon 优化器在训练大型语言模型和其他深度学习架构方面的进展和应用。MONA 将 Nesterov 加速引入 Muon,以提高收敛速度和下游任务性能,并在大型模型上取得了最先进的成果。MuCon 研究了对 Muon 更新进行裁剪,以在不进行完整奇异值分解的情况下近似其行为。另一项研究考察了 Muon 在对抗性训练中的有效性,表明在各种威胁模型和架构上,它可以与 SGD 和 AdamW 等标准优化器竞争或超越它们。…
-
Qwen发布27B多模态模型,用于高级编码
Qwen发布了Qwen3.6-27B,这是一款为高级编码任务设计的、参数量为270亿的密集多模态模型。该模型旨在提供旗舰级的智能体编码性能,超越了该类别中先前的开源模型。社区成员已在Hugging Face上提供了Qwen3.6-27B的各种量化版本,方便其在不同平台和库中使用。