Process Reward Model
PulseAugur coverage of Process Reward Model — every cluster mentioning Process Reward Model across labs, papers, and developer communities, ranked by signal.
-
新的训练方法改进了网络代理的世界模型
研究人员开发了一种名为预测状态匹配的新训练目标,用于网络代理中的世界模型。该方法旨在提高这些模型区分由不同操作产生的不同网络状态的能力,这对于准确的操作选择至关重要。该方法在源自 WebArena Go-Browse 轨迹的数据集上进行了测试,并在 WebPRMBench 和 WebArena-Lite 等基准测试中表现出改进的性能,最终提高了网络代理的端到端任务成功率。
-
新框架增强大型语言模型从示例合成程序的能力
研究人员开发了一个名为 PRM-PBE 的新框架,以增强大型语言模型 (LLM) 在编程示例 (PBE) 任务中的能力。该方法解决了当前 LLM 在 PBE 中的局限性,由于缺乏对中间推理过程的细粒度监督,它们通常难以从有限的输入输出示例中推断出底层程序逻辑。PRM-PBE 利用在反馈引导的推理树上训练的进程奖励模型 (PRM) 来评估中间步骤的可靠性,并结合三阶段课程学习方法和 PPO 优化来进行程序合成。在多个基准测试上的实验表明…
-
新的VRPRM模型利用视觉线索增强LLM推理能力
研究人员开发了VRPRM,一种新颖的过程奖励模型,它利用视觉推理来增强大型语言模型(LLM)推理步骤的细粒度评估。这种方法显著降低了此类模型训练通常需要的数据标注成本。与传统的非思考PRM相比,VRPRM表现出更优越的性能,仅用一小部分训练数据就取得了实质性改进。
-
新方法在解码时消除大型语言模型偏见,无需重新训练即可提高公平性
研究人员开发了一种新颖的方法,可以在解码阶段减轻大型语言模型的偏见,而无需更改模型的权重。该方法使用单独的过程奖励模型(PRM)对公平性和流畅性的 token 候选进行评分。顺序批评和修订方案被证明是最有效的,将偏见分数提高了高达 0.40,同时保持了流畅性。该框架在包括 GPT-4o-mini、Llama 3.2 3B、Gemma 3 4B 和 Qwen 2.5 3B 在内的模型上进行了评估。