研究人员开发了一种名为RSTG(通过自适应教师指导恢复学习信号)的新方法,以改进大型语言模型的强化学习。该技术通过选择性地从教师模型进行蒸馏来解决GRPO等方法中稀疏奖励信号的问题。RSTG将蒸馏集中在负零方差提示上,根据教师置信度对样本进行加权,并针对学生熵高或师生分歧大的特定标记。此外,它还结合了对教师生成的正确轨迹进行监督微调,在RL失败的地方注入正梯度信号。实验表明,RSTG在数学和代码任务上的表现明显优于标准的GRPO+OPD。 AI
影响 这项研究可能导致更有效和更强大的大型语言模型训练,提高它们在数学和编码等复杂任务上的性能。
排序理由 该集群包含一篇详细介绍改进LLM训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →