PulseAugur
实时 09:13:46
实体 Cumulative Process Rewards

Cumulative Process Rewards

PulseAugur coverage of Cumulative Process Rewards — every cluster mentioning Cumulative Process Rewards across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_165052 ·

    新的SPRO框架通过内在奖励增强LLM推理能力

    研究人员推出了一种名为自导过程奖励优化(SPRO)的新框架,旨在通过面向过程的强化学习来提高大型语言模型(LLM)的推理能力。SPRO通过从策略模型本身内在推导奖励,并重新定义累积过程奖励(CPR)和掩码步进优势(MSA)的步进优势,来解决传统过程奖励模型的计算开销问题。实验表明,与标准的GRPO相比,SPRO的训练效率提高了3.4倍,测试准确率提高了12.9%,同时保持了稳定的策略熵并缩短了响应长度。