研究人员开发了一种名为顺序自适应回滚分配 (SARA) 的新方法,以提高具有可验证奖励的强化学习 (RLVR) 的效率。SARA 通过使用 Beta 后验来跟踪成功率和类似 SPRT 的规则来提前放弃无效组,从而解决了在已确定完全正确或不正确的提示上浪费回滚的问题。这种方法将节省的预算重新分配给新提示,从而节省大量回滚并提高准确性,尤其是在与动态采样等现有方法结合使用时。 AI
影响 该方法可以通过减少计算资源的浪费来更有效地训练 RL 模型。
排序理由 这是一篇详细介绍 RLVR 新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →