PulseAugur
中
实时 11:36:53
实体 Rubric-based reinforcement learning

Rubric-based reinforcement learning

PulseAugur coverage of Rubric-based reinforcement learning — every cluster mentioning Rubric-based reinforcement learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_280182 ·

    新训练方法使用评分标准指导语言模型进行RL

    研究人员开发了一种新颖的语言模型两阶段训练框架,该框架利用评分标准来提高需要开放式回答的任务的性能。第一阶段,基于评分标准的策略内蒸馏(RP-OPD),使用评分标准作为特权教师上下文进行密集的token级监督。第二阶段采用强化学习(RL)直接优化评分奖励,以蒸馏阶段为基础。该方法在健康和科学任务上进行了评估,其性能优于标准的监督微调(SFT)后接RL的方法,并且表现出较少的奖励破解迹象。