PulseAugur
实时 14:50:33
实体 Process Reward Model

Process Reward Model

PulseAugur coverage of Process Reward Model — every cluster mentioning Process Reward Model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_94209 ·

    新框架增强大型语言模型从示例合成程序的能力

    研究人员开发了一个名为 PRM-PBE 的新框架,以增强大型语言模型 (LLM) 在编程示例 (PBE) 任务中的能力。该方法解决了当前 LLM 在 PBE 中的局限性,由于缺乏对中间推理过程的细粒度监督,它们通常难以从有限的输入输出示例中推断出底层程序逻辑。PRM-PBE 利用在反馈引导的推理树上训练的进程奖励模型 (PRM) 来评估中间步骤的可靠性,并结合三阶段课程学习方法和 PPO 优化来进行程序合成。在多个基准测试上的实验表明…

  2. RESEARCH · CL_44959 ·

    新的VRPRM模型利用视觉线索增强LLM推理能力

    研究人员开发了VRPRM,一种新颖的过程奖励模型,它利用视觉推理来增强大型语言模型(LLM)推理步骤的细粒度评估。这种方法显著降低了此类模型训练通常需要的数据标注成本。与传统的非思考PRM相比,VRPRM表现出更优越的性能,仅用一小部分训练数据就取得了实质性改进。

  3. RESEARCH · CL_15892 ·

    新方法在解码时消除大型语言模型偏见,无需重新训练即可提高公平性

    研究人员开发了一种新颖的方法,可以在解码阶段减轻大型语言模型的偏见,而无需更改模型的权重。该方法使用单独的过程奖励模型(PRM)对公平性和流畅性的 token 候选进行评分。顺序批评和修订方案被证明是最有效的,将偏见分数提高了高达 0.40,同时保持了流畅性。该框架在包括 GPT-4o-mini、Llama 3.2 3B、Gemma 3 4B 和 Qwen 2.5 3B 在内的模型上进行了评估。