研究人员开发了GRAFT,一个旨在增强具有可验证奖励(RLVR)的强化学习方法(如GRPO)的新框架。GRAFT解决了RLVR中有限的rollout预算问题,这可能导致缺乏策略梯度信号的“全失败”组。通过允许异构模型交换成功的轨迹,GRAFT使它们能够从彼此的发现中学习,从而提高数学推理基准的性能。该框架还控制了跨模型不匹配,并且即使在使用存储的同伴轨迹时也能在很大程度上保持性能提升。 AI
影响 这项研究通过促进异构模型之间更好的知识共享,可能导致更有效的RL模型训练。
排序理由 这是一篇详细介绍强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →