PulseAugur
实时 10:32:45
实体 Direct On-Policy Distillation

Direct On-Policy Distillation

PulseAugur coverage of Direct On-Policy Distillation — every cluster mentioning Direct On-Policy Distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_139531 ·

    新框架通过减少弱模型中的噪声来增强 LLM 训练

    研究人员开发了一个名为对比弱到强泛化(ConG)的新框架,以改进大型语言模型的训练。ConG 解决了现有弱到强泛化方法中的局限性,这些方法可能受到弱模型中噪声和偏差的阻碍。通过利用隐式奖励和对比解码,ConG 生成了更高质量的样本,从而实现了更可靠的能力转移和更强的鲁棒性。这种方法在各种模型家族中都显示出了一致的改进,为推进 LLM 训练提供了一条有前途的途径。

  2. RESEARCH · CL_128417 ·

    新研究探索可控泛化失败和LLM的高效RL蒸馏

    研究人员正在探索改进语言模型泛化和推理能力的新方法。一篇论文提出了一种构建模型的技术,通过在条件策略的混合物上进行训练来展示可控的泛化失败,这有助于进行对齐压力测试。另一项研究引入了直接策略内蒸馏(Direct-OPD)作为一种更有效的方式,将强化学习的收益从小型模型转移到大型模型,无需昂贵的奖励建模或在大型模型上进行直接RL。该方法已显示出显著的改进,例如在AIME 2024基准测试中提升了Qwen3-1.7B的性能。