PulseAugur
实时 11:01:12
English(EN) Adaptive Optimization via Momentum on Variance-Normalized Gradients

新的MVN-Grad优化器提高了深度学习的稳定性和性能

研究人员推出了一种新颖的优化算法MVN-Grad,旨在提高深度学习模型的稳定性和性能。该方法将基于方差的归一化与归一化后的动量相结合,旨在缓解Adam等标准优化器中存在的梯度尖峰和跨时间耦合等问题。在CIFAR-100图像分类和GPT风格语言建模等任务上,MVN-Grad与现有优化器相比,在计算开销仅略微增加的情况下,实现了具有竞争力的或更优的结果,提供了更平稳的训练和更好的泛化能力。 AI

影响 这项新的优化技术可能带来更稳定、更高效的大型语言模型和其他深度学习架构的训练。

排序理由 该集群包含一篇详细介绍机器学习新优化算法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MVN-Grad优化器提高了深度学习的稳定性和性能

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Francisco Patitucci, Aryan Mokhtari ·

    基于方差归一化梯度的自适应优化

    arXiv:2602.10204v2 Announce Type: replace Abstract: We introduce MVN-Grad (Momentum on Variance-Normalized Gradients), an Adam-style optimizer that improves stability and performance by combining two complementary ideas: variance-based normalization and momentum applied after nor…