研究人员提出了一个关于持续学习和模型合并的新视角,将两者都视为“任务干扰”的实例。这种干扰由层状Frobenius内积量化,并受基础优化器影响。该研究将参数更新的谱范数确定为一个可由优化器控制的关键因素,而Muon优化器则展示了调节该因素的能力。实验表明,用Muon替换AdamW可以在模型合并基准测试中显著提高准确性,并在持续学习场景中带来一致的收益。 AI
影响 引入了一种新颖的以优化器为中心的方法来解决持续学习和模型合并中的基本挑战,有可能提高模型的性能和效率。
排序理由 学术论文,介绍了一种新的优化器理论框架和经验验证。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →