PulseAugur
实时 09:16:53

新方法通过恢复学习信号来增强LLM的强化学习

研究人员开发了一种名为RSTG(通过自适应教师指导恢复学习信号)的新方法,以改进大型语言模型的强化学习。该技术通过选择性地从教师模型进行蒸馏来解决GRPO等方法中稀疏奖励信号的问题。RSTG将蒸馏集中在负零方差提示上,根据教师置信度对样本进行加权,并针对学生熵高或师生分歧大的特定标记。此外,它还结合了对教师生成的正确轨迹进行监督微调,在RL失败的地方注入正梯度信号。实验表明,RSTG在数学和代码任务上的表现明显优于标准的GRPO+OPDAI

影响 这项研究可能导致更有效和更强大的大型语言模型训练,提高它们在数学和编码等复杂任务上的性能。

排序理由 该集群包含一篇详细介绍改进LLM训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法通过恢复学习信号来增强LLM的强化学习

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong ·

    Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

    arXiv:2608.00782v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR) has become a standard paradigm for post-training large language models (LLMs). While Group Relative Policy Optimization (GRPO) is widely adopted, it suffers from sparse reward si…