研究人员推出了一种新颖的具有可验证奖励的强化学习(RLVR)方法——Bellman策略优化(BPO),旨在增强大型语言模型(LLMs)的推理能力。BPO是一种无判别器的方法,源自策略镜像下降(PMD),它将PMD重构为使用Bellman方程的轨迹级目标。这种重构绕过了在中间步骤估计状态值的需求,并且其实际损失函数通过基于平滑标记概率的失配校正权重进行近似。在数学推理基准上的实验表明BPO是有效的。 AI
影响 这种新方法可以提高大型语言模型在数学问题解决等复杂任务中的推理能力。
排序理由 这是一篇详细介绍强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bellman equations
- Bellman Policy Optimization
- Hugging Face
- large language models
- Reinforcement Learning with Verifiable Rewards
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →