PulseAugur
实时 06:54:03

新型优化器提升扩散Transformer训练效率

研究人员开发了一种名为周期性逐行Muon(Periodic Row-wise Muon)的新优化技术,以提高扩散Transformer(DiTs)的训练效率。该方法基于原始Muon优化器,通过减少完全谱更新的频率,并对剩余步骤使用计算效率更高的逐行更新。协同设计的分布式实现通过直接操作分片动量并使计算与通信重叠来进一步提高速度。新技术在保持生成质量不变或略有提高的同时,显著减少了优化器时间、步长时间和通信量,从而提高了训练大型DiTs的效率。 AI

影响 提高了大型扩散模型的训练效率,可能加速生成式AI的研究和开发。

排序理由 详细介绍AI模型新优化技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型优化器提升扩散Transformer训练效率

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chenghao Li, Xiao Han, Xinxin Huang, Wei Liu, Boyang Li, Bing Xiao, Heran Zhang, Juanma Perez Rua, Ke Xu, Kangning Liu, Linjun Kuang, Na Li, Tan Wang, Tian Xie, Wei Peng, Yang Pei, Yifan Xu, Yuanhao Zhai, Yuwei Lin, Zhe Wang, Zihao He, Daniel Li, Junbiao… ·

    Scaling Muon for Diffusion Transformers

    arXiv:2608.20818v1 Announce Type: cross Abstract: The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion Transformers (DiTs) remain unclear. We first esta…