一篇新的研究论文探讨了在可验证奖励强化学习(RLVR)中出现的“pass@k反转”现象。当RLVR提高模型单样本准确率,但降低其在需要多次尝试(更高k)的任务上的表现时,就会发生这种情况。该论文认为这是由于证据缺失导致的失败,即在RLVR训练过程中,稀有的正确轨迹会丢失。一种名为“逐问题基准锚定”(PBA)的提议方法,旨在通过优化提示并根据基准模型的分布锚定高风险提示来缓解这一问题,并在Omni-MATH-Test等基准测试中取得了改进的结果。 AI
影响 这项研究通过解决可验证奖励系统中的特定失效模式,可能导致更强大的AI模型,并可能提高在复杂推理任务上的表现。
排序理由 学术论文,详细介绍了新颖的研究发现和提出的方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →