研究人员推出了一种新颖的等谱优化(ISO)框架,旨在增强可验证奖励强化学习(RLVR)的优化过程。ISO 利用谱继承的概念,其中 RLVR 在重用基础模型的权重谱的同时,通过改变奇异帧来调整其行为。该方法提供了离线和在线的实例化:ISO-Merger 组合了专家模型,无需合并后数据或梯度更新;ISO-Optimizer 将 AdamW 等标准优化器应用于帧变量,同时保持谱固定。实验表明,ISO-Optimizer 显著减少了训练步数,并提高了各种模型大小的推理和编码任务的准确性,尤其是在 Qwen3-8B-Base 上以更少的步数达到了与 AdamW 相同的准确率。 AI
影响 引入了一种更有效的 RLVR 优化方法,有望加速先进语言模型的开发和微调。
排序理由 该集群包含一篇详细介绍语言模型新优化框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →