On-Policy Distillation
PulseAugur coverage of On-Policy Distillation — every cluster mentioning On-Policy Distillation across labs, papers, and developer communities, ranked by signal.
- instance of FLNA 90%
- instance of On-policy self-distillation 70%
- competes with Reinforcement Learning with Verifiable Rewards 70%
- competes with Grpo 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- other Reinforcement Learning with Verifiable Rewards 60%
- used by Reinforcement Learning with Verifiable Rewards 50%
- other ScienceCast 50%
8 天有情绪数据
-
策略内蒸馏:困难示例可提升大型语言模型的推理能力
一篇新论文探讨了在策略内蒸馏(On-Policy Distillation, OPD)对于增强大型语言模型的有效性,特别关注数据效率和数据选择。研究发现,即使是单个示例(1-shot OPD)也可能有效,而更困难的示例通常能带来更优越的性能提升。研究表明,这种改进源于复杂问题中更长的思维链(Chain-of-Thought, CoT)路径,这有助于保持与教师模型的对齐并教授批判性思维模式。基于这些发现,提出了一种仅使用困难示例的数据选…
-
RISE 方法通过自我外推和策略蒸馏增强语言模型
研究人员推出了一种名为 RISE 的新方法,通过自我外推和策略蒸馏来改进语言模型。与依赖外部教师或有限的上下文内学习的先前方法不同,RISE 从模型自身的训练轨迹构建了一个合成教师。该合成教师通过外推模型的进展提供密集的、token 级别的监督。实验表明,在数学推理、STEM 和代码生成等各种任务上,RISE 的表现优于标准的人类反馈强化学习 (RLHF) 和同策略自我蒸馏。
-
新研究论文详细介绍了用于增强LLM推理能力的OPD-then-RL方法
一篇新研究论文提出了一个名为OPD-then-RL的两阶段方法,用于提高大型语言模型的推理能力。该方法结合了On-Policy Distillation (OPD) 和 Reinforcement Learning with Verifiable Rewards (RLVR),首先使用OPD进行广泛覆盖,然后应用RLVR进行精炼。实验表明,这种顺序策略在逻辑和数学推理基准测试中优于联合优化方法。
-
新的CA-OPD框架通过置信度感知蒸馏改进视觉语言模型
研究人员开发了一个名为置信度感知策略内蒸馏(CA-OPD)的新框架,以改进自回归视觉语言模型。该方法通过利用教师置信度来纠正训练过程中不可靠的学生预测,从而解决累积误差问题。CA-OPD将知识转移与干预决策对齐,在纠正的位置提供直接监督,在保留的位置提供完整的预测分布。当应用于GUI定位和光学字符识别任务时,CA-OPD显著增强了Qwen3.5-0.8B基线模型,在ScreenSpot-Pro和OCRBench-v2 English等…
-
新的蒸馏方法提升大语言模型训练效率
研究人员开发了新的在线蒸馏(OPD)方法来改进语言模型的训练。其中一种方法,教师门控在线蒸馏(TGOPD),在应用监督之前,在提示级别验证教师的可靠性,在各种领域和规模上均优于普通OPD。另一种方法将离线教师优化与在线学生蒸馏相结合,显示出显著的收益,尤其是在分布变化下,并取得了与更大模型相媲美的性能。
-
Cliff 方法通过奖励正确的前缀来改进 LLM 推理
研究人员推出了一种名为 Cliff 的新颖奖励塑造策略,用于大型语言模型中的可验证奖励强化学习 (RLVR)。Cliff 利用现成的语言模型来精确定位推理过程中的第一个错误,从而将生成过程划分为一个正确的前缀和一个不正确的后缀。这种方法将信号转换为 token 级优势,提供了比传统基于结果的奖励更精细化的反馈。实验表明,Cliff 显著提高了推理性能,优于现有的方法,如 On-Policy Distillation 和 GRPO。
-
新的 OPSA 方法质疑 on-policy distillation 的有效性
研究人员质疑了 on-policy distillation (OPD) 在大型语言模型中的有效性,发现其监督可能存在噪声,并且学生模型对这种噪声基本不敏感。OPD 的收益似乎源于抑制低概率 token,而非直接的教师指导。这促使了 On-Policy Self-Adaptation (OPSA) 的开发,这是一种新的无监督方法,利用熵自适应负优势来提高模型性能。OPSA 显著提升了推理能力,在 AIME24 等基准测试中表现优于 OPD。
-
新方法提升扩散 Transformer 的全模态生成效率
研究人员开发了一种用于高效上下文内扩散 Transformer 的新方法,可改进全模态生成。该技术称为 Anchoring Instruction Outside Mask,使用静态文本锚点将视觉参考与文本指令连接起来,克服了先前稀疏注意力方法的局限性。通过允许重用参考键和值,同时增强指令遵循和参考保真度,该方法保留了计算效率。该方法实现了与全注意力生成相当的质量,并显著加速了去噪过程,参考图像越多,加速效果越明显。
-
新的Latent-OPD方法增强了LMM在帧高效视频推理方面的能力
研究人员推出了一种新方法Latent-OPD,用于提高大型多模态模型(LMM)在视频推理方面的效率。该技术通过引入轨迹级潜在蒸馏来增强On-Policy Distillation(OPD),专注于推理轨迹末端的隐藏状态,以更好地捕捉累积的视觉证据。一种渐进式教师前瞻策略进一步将学生模型层与更深的教师层对齐。在六个视频推理基准上的实验表明,Latent-OPD的性能显著优于标准的仅输出OPD,尤其是在帧数有限、视频长或证据聚合任务复杂的…
-
新框架FlowErase-OPD可在文本到图像模型中实现多概念擦除
研究人员开发了FlowErase-OPD,一个旨在通过同时擦除多个概念来提高文本到图像生成模型安全性的新框架。该方法利用策略内蒸馏,并引入了锚定多教师蒸馏(AMTD)和自适应保留控制(ARC)等新技术,以平衡概念擦除与生成能力的保持。实验表明,FlowErase-OPD在有效移除裸露或特定风格等概念的同时,保持图像质量和语义一致性方面优于现有方法。
-
新的蒸馏技术提升了大型语言模型的多语言数学推理能力
研究人员探索了在线策略增量蒸馏(OPD^2),这是在线策略蒸馏(OPD)的一项改进,用于多语言数学推理。使用Qwen3模型的实验表明,OPD^2在英语、韩语和日语上的表现显著优于标准的OPD。研究还指出,虽然仅使用英语的OPD可以提升其他语言的性能,但可能会无意中将响应转向英语,这凸显了使用多语言数据来维持特定语言响应的必要性。
-
Hunyuan3架构通过跨域蒸馏增强搜索代理
研究人员开发了一种名为Yuanbao的自主搜索代理新训练框架,该框架基于Hunyuan3架构构建。该框架采用了一种混合方法,将强化学习与跨域专家策略内蒸馏(OPD)相结合。其目标是在不牺牲通用智能的情况下,使代理专注于搜索任务,从而减轻常见的“对齐税”。实验表明,由此产生的模型在搜索任务上表现具有竞争力,同时增强了其通用能力。
-
新的蒸馏方法FTB通过验证教师指导来提高智能体性能
研究人员开发了一种名为FutureBridge-OPD (FTB) 的新方法,以改进智能体任务的策略内蒸馏 (OPD)。标准的OPD在教师访问的状态上监督学生,但学生的偏差可能导致随时间的指导效果不佳。FTB通过观察学生的后续轨迹来评估在高分歧状态下教师指导的好处,从而解决这个问题。在ALFWorld、WebShop和ScienceWorld上的实验中,FTB在现有方法上显示出显著的性能提升,当使用Qwen3-32B作为Qwen3-1…
-
新的MAGA方法融合GUI代理以实现跨环境部署
研究人员开发了MAGA,一种将专门的GUI代理整合为单一跨环境策略的新颖方法。与以往在冲突动作或同等对待所有响应令牌方面存在困难的方法不同,MAGA根据生成动作的正确性重新分配训练信号。这种方法将学习重点放在错误的动作上,并使用仅用于训练的提示来优化来自领域特定教师的监督信号,而不会改变学生输入。在两个模型规模上,MAGA都表现出卓越的性能,实现了最高的平均成功率,并接近匹配教师的性能。
-
新方法RSTG通过自适应教师指导改进LLM强化学习
研究人员开发了RSTG(Recovering Learning Signals via Adaptive Teacher Guidance,通过自适应教师指导恢复学习信号),一种改进大型语言模型强化学习的新方法。现有的GRPO等方法在稀疏奖励方面存在困难,而与在线蒸馏(OPD)的简单组合可能会降低性能。RSTG选择性地将蒸馏应用于负面提示,根据教师的置信度对样本进行加权,并针对特定标记进行蒸馏。它还通过注入正梯度来纳入教师生成的轨迹上…
-
新的字节前缀边际化方法改进语言模型蒸馏
研究人员开发了一种名为字节前缀边际化(BPM)的新方法,用于开放权重语言模型的在线策略蒸馏(OPD)。BPM通过在共享字节空间中重新表达教师模型在学生模型词汇表上的概率分布,解决了合并具有不同分词器的模型所面临的挑战。即使分词器不同,该方法也能确保概率质量的保留和准确映射。实验表明,当与Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7等模型一起使用时,BPM在数学和编程基准测试上的表现显著优于现有的跨分词器方法。
-
视觉对比自蒸馏改进 Qwen VL 模型
研究人员开发了视觉对比自蒸馏(VCSD)方法,这是一种无需外部教师或特权信息即可改进视觉语言模型(VLM)的新颖方法。VCSD 通过比较模型在原始图像和内容擦除版本上的预测,并利用差异来完善模型对视觉内容的理解。该方法在各种 Qwen 模型上均显示出持续的性能提升,在不增加计算开销的情况下显著提高了基准分数。
-
新研究通过先进的推测解码技术提高LLM推理速度 · 追踪8个来源
研究人员正在探索先进技术,通过推测解码来加速大型语言模型(LLM)的推理。"Functional Reconstruction"等新方法旨在通过优化注意力函数来提高草稿模型和目标模型之间的一致性,而"SparseSpec-L"则利用动态稀疏化的KV缓存和每头注意力统计数据来提高效率。其他工作重新审视了"lossy verification"以分析权衡和失败模式,并将方法分为基于截断和协作验证。此外,"AngelSpec"为不同的推测解…
-
新研究分析SFT、RL和OPD如何塑造LLM推理置信度
一篇新研究论文提出了一个三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度校准。该研究在数学推理基准上进行,发现OPD对于预推理置信度最有效,SFT在提前停止方面表现最佳,而RL为答案聚合提供了最可靠的信号。研究人员还开发了PosConf,一种位置感知置信度策略,通过利用来自可靠相对位置区间的置信度信号,改进了RL答案聚合和OPD提前停止。
-
新基准和方法推动医学视觉语言模型发展
研究人员开发了新的基准和蒸馏技术,以提高视觉语言模型(VLM)在医学领域的性能。PathAgentBench 专注于评估 VLM 直接从全切片病理图像中获取和整合证据的能力,揭示了当前模型在证据获取方面存在显著的性能差距。同时,Med-OPD 引入了一种面向证据的在线策略蒸馏方法,以增强医学 VLM 对视觉证据的依赖,而非语言先验。此外,一个用于 PET/CT 报告生成的新越南语多模态数据集旨在提高 VLM 在低资源语言和功能成像任务…