PulseAugur
实时 07:21:09
English(EN) Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

新的 SARA 方法通过自适应回滚分配提高了 RLVR 效率

研究人员开发了一种名为顺序自适应回滚分配 (SARA) 的新方法,以提高具有可验证奖励的强化学习 (RLVR) 的效率。SARA 通过使用 Beta 后验来跟踪成功率和类似 SPRT 的规则来提前放弃无效组,从而解决了在已确定完全正确或不正确的提示上浪费回滚的问题。这种方法将节省的预算重新分配给新提示,从而节省大量回滚并提高准确性,尤其是在与动态采样等现有方法结合使用时。 AI

影响 该方法可以通过减少计算资源的浪费来更有效地训练 RL 模型。

排序理由 这是一篇详细介绍 RLVR 新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 SARA 方法通过自适应回滚分配提高了 RLVR 效率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes ·

    早期结论,更优预算:用于计算高效 RLVR 的顺序自适应部署分配

    arXiv:2607.26253v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR) is bottlenecked by rollout generation, yet many sampled prompts produce saturated groups (all responses correct or all incorrect) whose zero reward variance yields no policy-grad…