PulseAugur
实时 14:53:53
实体 SR-PPO

SR-PPO

PulseAugur coverage of SR-PPO — every cluster mentioning SR-PPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_109549 ·

    新的SR-PPO方法通过单次采样改进语言模型的强化学习

    研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。