研究人员开发了RSTG(Recovering Learning Signals via Adaptive Teacher Guidance,通过自适应教师指导恢复学习信号),一种改进大型语言模型强化学习的新方法。现有的GRPO等方法在稀疏奖励方面存在困难,而与在线蒸馏(OPD)的简单组合可能会降低性能。RSTG选择性地将蒸馏应用于负面提示,根据教师的置信度对样本进行加权,并针对特定标记进行蒸馏。它还通过注入正梯度来纳入教师生成的轨迹上的监督微调(SFT)。实验表明,RSTG在数学和代码任务上的表现显著优于标准方法。 AI
影响 这项研究通过提高强化学习技术的效率和有效性,有望带来更强大的LLM。
排序理由 该集群包含一篇详细介绍改进LLM训练新方法的 ist 研究论文。
- GRPO
- RLVR
- RSTG
- supervised fine-tuning
- Group Relative Policy Optimization
- Hugging Face
- large language models
- On-policy distillation
- Recovering Learning Signals via Adaptive Teacher Guidance
- Reinforcement learning with verifiable rewards
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →