PulseAugur
实时 23:50:34

新的蒸馏方法增强了大型语言模型的推理能力

研究人员推出了一种新颖的强化学习训练后方法——On-Policy Delta Distillation (OPD²),该方法利用“delta信号”将推理能力从教师模型转移到学生模型。该delta信号捕获了推理调优引起的特定变化,比传统的模仿方法提供了更直接的监督信号。在数学、科学和代码推理基准上的实验表明,OPD²的性能始终优于传统的on-policy蒸馏,在更短的训练后周期内取得了强劲的性能。该方法已在各种Qwen3模型尺寸上证明了有效性,并能泛化到Gemma 4。 AI

影响 这项新的蒸馏技术可能导致更有效地训练大型语言模型以完成复杂的推理任务,从而可能提高数学、科学和编码等各个领域的性能。

排序理由 该集群描述了一篇介绍大型语言模型训练新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的蒸馏方法增强了大型语言模型的推理能力

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    On-Policy Delta Distillation

    On-policy distillation is an alternative post-training method in reinforcement learning that alleviates the constraints imposed by reward models by providing token-level supervision from a teacher model. Although on-policy distillation has been studied and applied across various …