研究人员推出了一种名为自导过程奖励优化(SPRO)的新框架,旨在通过面向过程的强化学习来提高大型语言模型(LLM)的推理能力。SPRO通过从策略模型本身内在推导奖励,并重新定义累积过程奖励(CPR)和掩码步进优势(MSA)的步进优势,来解决传统过程奖励模型的计算开销问题。实验表明,与标准的GRPO相比,SPRO的训练效率提高了3.4倍,测试准确率提高了12.9%,同时保持了稳定的策略熵并缩短了响应长度。 AI
影响 该框架可能导致LLM在复杂推理任务中的训练效率更高,从而可能降低计算成本并提高性能。
排序理由 该集群包含一篇详细介绍过程强化学习新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Cumulative Process Rewards
- GRPO
- Hao Kong
- large-language models
- Masked Step Advantage
- Process Reinforcement Learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →