研究人员开发了一种新颖的语言模型两阶段训练框架,该框架利用评分标准来提高需要开放式回答的任务的性能。第一阶段,基于评分标准的策略内蒸馏(RP-OPD),使用评分标准作为特权教师上下文进行密集的token级监督。第二阶段采用强化学习(RL)直接优化评分奖励,以蒸馏阶段为基础。该方法在健康和科学任务上进行了评估,其性能优于标准的监督微调(SFT)后接RL的方法,并且表现出较少的奖励破解迹象。 AI
影响 该方法通过提供更有针对性的训练信号,有可能提高语言模型在复杂、开放式任务上的性能。
排序理由 该集群包含一篇详细介绍语言模型新训练方法的 ist 研究论文。
- arXiv
- HealthBench
- On-Policy Distillation
- ResearchQA
- RP-OPD
- Rubric-based reinforcement learning
- RubricHub Science
- supervised fine-tuning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →