研究人员推出了一种新颖的强化学习训练后方法——On-Policy Delta Distillation (OPD²),该方法利用“delta信号”将推理能力从教师模型转移到学生模型。该delta信号捕获了推理调优引起的特定变化,比传统的模仿方法提供了更直接的监督信号。在数学、科学和代码推理基准上的实验表明,OPD²的性能始终优于传统的on-policy蒸馏,在更短的训练后周期内取得了强劲的性能。该方法已在各种Qwen3模型尺寸上证明了有效性,并能泛化到Gemma 4。 AI
影响 这项新的蒸馏技术可能导致更有效地训练大型语言模型以完成复杂的推理任务,从而可能提高数学、科学和编码等各个领域的性能。
排序理由 该集群描述了一篇介绍大型语言模型训练新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →