PulseAugur
实时 08:00:12
English(EN) H$^2$SD: Hybrid Hindsight Self-Distillation

新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力

研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略蒸馏(OPD)和强化学习自蒸馏(RLSD)方法。 AI

影响 增强LLM的推理能力和效率,可能提高在数学和代码生成等复杂任务上的性能。

排序理由 该集群描述了一篇关于改进LLM推理能力的新颖方法的新研究论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Qiye Cai, Yichuan Ma, Linyang Li, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Tao Gui, Xiaocheng Feng, Bing Qin ·

    H$^2$SD:混合滞后自蒸馏

    arXiv:2607.18955v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) has substantially improved the reasoning capabilities of large language models on tasks such as mathematical reasoning and code generation. However, most RLVR methods assign a …

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    H^2SD:混合滞后自蒸馏

    Reinforcement learning with verifiable rewards (RLVR) has substantially improved the reasoning capabilities of large language models on tasks such as mathematical reasoning and code generation. However, most RLVR methods assign a scalar outcome reward to an entire trajectory, res…