实体
On-Policy Delta Distillation
On-Policy Delta Distillation
PulseAugur coverage of On-Policy Delta Distillation — every cluster mentioning On-Policy Delta Distillation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的On-Policy Delta Distillation方法增强了LLM的推理能力
研究人员引入了一种名为On-Policy Delta Distillation (OPD^2) 的新方法,以提高大型语言模型中推理能力的迁移。该技术利用“delta信号”(表示指令微调前教师模型与其基础模型之间的差异)来提供更直接的监督。在数学、科学和代码推理任务上的实验表明,OPD^2 的性能显著优于传统的on-policy distillation,使得LLM能够以最小的训练后调整实现强大的推理性能。
-
新的蒸馏方法增强了大型语言模型的推理能力
研究人员推出了一种新颖的强化学习训练后方法——On-Policy Delta Distillation (OPD²),该方法利用“delta信号”将推理能力从教师模型转移到学生模型。该delta信号捕获了推理调优引起的特定变化,比传统的模仿方法提供了更直接的监督信号。在数学、科学和代码推理基准上的实验表明,OPD²的性能始终优于传统的on-policy蒸馏,在更短的训练后周期内取得了强劲的性能。该方法已在各种Qwen3模型尺寸上证明了…