一项新的研究论文探讨了具有可验证奖励的强化学习(RLVR)如何无意中缩小 AI 模型的解决方案空间,从而影响其扩展能力。该研究使用 Countdown 任务分析了 Qwen2.5-3B 和 GRPO 在 Qwen2.5-3B-Instruct 上的模型,发现解决方案广度的损失集中在推理的初始阶段。研究人员证明,针对这些早期步骤的干预可以在不牺牲准确性的情况下恢复解决方案的多样性,这表明这种广度收缩并非推理优化的固有局限性。 AI
影响 这项研究强调了 RLVR 训练中潜在的权衡,表明可以通过有针对性的干预来保持模型广度,这可能会为未来更强大的 AI 推理训练方法提供信息。
排序理由 研究论文,详细介绍了 AI 模型行为的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- Direct Preference Optimization
- GRPO
- Proximal Policy Optimization
- Qwen2.5-3B
- Qwen2.5-3B-Instruct
- RLVR
- supervised fine-tuning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →