PulseAugur
实时 12:59:21
实体 On-Policy Delta Distillation

On-Policy Delta Distillation

PulseAugur coverage of On-Policy Delta Distillation — every cluster mentioning On-Policy Delta Distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_191658 ·

    新的蒸馏技术提升了大型语言模型的多语言数学推理能力

    研究人员探索了在线策略增量蒸馏(OPD^2),这是在线策略蒸馏(OPD)的一项改进,用于多语言数学推理。使用Qwen3模型的实验表明,OPD^2在英语、韩语和日语上的表现显著优于标准的OPD。研究还指出,虽然仅使用英语的OPD可以提升其他语言的性能,但可能会无意中将响应转向英语,这凸显了使用多语言数据来维持特定语言响应的必要性。

  2. RESEARCH · CL_147422 ·

    新的On-Policy Delta Distillation方法增强了LLM的推理能力

    研究人员引入了一种名为On-Policy Delta Distillation (OPD^2) 的新方法,以提高大型语言模型中推理能力的迁移。该技术利用“delta信号”(表示指令微调前教师模型与其基础模型之间的差异)来提供更直接的监督。在数学、科学和代码推理任务上的实验表明,OPD^2 的性能显著优于传统的on-policy distillation,使得LLM能够以最小的训练后调整实现强大的推理性能。

  3. RESEARCH · CL_152127 ·

    新的蒸馏方法增强了多模态AI的推理能力

    研究人员开发了新的策略内蒸馏技术,以改进多模态AI模型。OPOD方法将学生响应路由到特定模态的教师,在各种基准测试中取得了最先进的成果。对比策略内蒸馏(COPD)和策略内增量蒸馏(OPD^2)分别通过关注相对推理兼容性和指令调优的增量信号,进一步改进了这一点,从而实现了更高效、更强大的模型。