PulseAugur
中
实时 04:21:19

新GRAFT框架通过交换同伴轨迹增强RLVR

研究人员开发了GRAFT,一个旨在增强具有可验证奖励(RLVR)的强化学习方法(如GRPO)的新框架。GRAFT解决了RLVR中有限的rollout预算问题,这可能导致缺乏策略梯度信号的“全失败”组。通过允许异构模型交换成功的轨迹,GRAFT使它们能够从彼此的发现中学习,从而提高数学推理基准的性能。该框架还控制了跨模型不匹配,并且即使在使用存储的同伴轨迹时也能在很大程度上保持性能提升。 AI

影响 这项研究通过促进异构模型之间更好的知识共享,可能导致更有效的RL模型训练。

排序理由 这是一篇详细介绍强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新GRAFT框架通过交换同伴轨迹增强RLVR

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    学习超越采样内容:用于RLVR的策略外感知跨模型轨迹交换

    Reinforcement Learning with Verifiable Rewards (RLVR) methods such as GRPO rely on successful self-generated trajectories, but finite rollout budgets can produce all-fail groups with no reward-based policy-gradient signal. While additional rollouts improve the chance of success a…