PulseAugur
实时 07:53:26
实体 Salman Rahman

Salman Rahman

PulseAugur coverage of Salman Rahman — every cluster mentioning Salman Rahman across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_229009 ·

    ScalePRM 在无需真实标签的情况下训练 AI 奖励模型,性能优于 GPT-4o

    研究人员开发了 ScalePRM,一种新颖的训练过程奖励模型(PRMs)的方法,该方法绕过了昂贵的步骤级正确性标签或真实标签的需要。该方法通过生成和聚合每个推理步骤的多个独立验证来创建合成标签,从而扩展了验证计算。ScalePRM 在 ProcessBench 基准测试上取得了 67.5 的 F1 分数,性能优于传统的基于真实标签的训练,甚至优于作为批评者的 GPT-4o。当用作 Qwen2.5-Math-7B 的 RL 训练的奖励信…