PulseAugur
实时 08:40:18
English(EN) Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

新的SPRO框架通过内在奖励增强LLM推理能力

研究人员推出了一种名为自导过程奖励优化(SPRO)的新框架,旨在通过面向过程的强化学习来提高大型语言模型(LLM)的推理能力。SPRO通过从策略模型本身内在推导奖励,并重新定义累积过程奖励(CPR)和掩码步进优势(MSA)的步进优势,来解决传统过程奖励模型的计算开销问题。实验表明,与标准的GRPO相比,SPRO的训练效率提高了3.4倍,测试准确率提高了12.9%,同时保持了稳定的策略熵并缩短了响应长度。 AI

影响 该框架可能导致LLM在复杂推理任务中的训练效率更高,从而可能降低计算成本并提高性能。

排序理由 该集群包含一篇详细介绍过程强化学习新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SPRO框架通过内在奖励增强LLM推理能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong ·

    Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

    arXiv:2507.01551v3 Announce Type: replace-cross Abstract: Process Reinforcement Learning~(PRL) has demonstrated considerable potential in enhancing the reasoning capabilities of Large Language Models~(LLMs). However, introducing additional process reward models incurs substantial…