研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略蒸馏(OPD)和强化学习自蒸馏(RLSD)方法。 AI
影响 增强LLM的推理能力和效率,可能提高在数学和代码生成等复杂任务上的性能。
排序理由 该集群描述了一篇关于改进LLM推理能力的新颖方法的新研究论文。
- arXiv
- H$^2$SD
- Hugging Face
- Kullback–Leibler divergence
- On-Policy Distillation
- On-policy self-distillation
- Reinforcement Learning with Verifiable Rewards
- RLVR
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →