PulseAugur
实时 08:22:07
实体 process reward modeling

process reward modeling

PulseAugur coverage of process reward modeling — every cluster mentioning process reward modeling across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_233133 ·

    Cliff 方法通过奖励正确的前缀来改进 LLM 推理

    研究人员推出了一种名为 Cliff 的新颖奖励塑造策略,用于大型语言模型中的可验证奖励强化学习 (RLVR)。Cliff 利用现成的语言模型来精确定位推理过程中的第一个错误,从而将生成过程划分为一个正确的前缀和一个不正确的后缀。这种方法将信号转换为 token 级优势,提供了比传统基于结果的奖励更精细化的反馈。实验表明,Cliff 显著提高了推理性能,优于现有的方法,如 On-Policy Distillation 和 GRPO。