On-policy self-distillation
PulseAugur coverage of On-policy self-distillation — every cluster mentioning On-policy self-distillation across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新数据集AMPLE-Math 探究特权信息在 LLM 自蒸馏中的价值
研究人员开发了一个新的数据集 AMPLE-Math,其中包含超过 5000 个数学问题,用于研究特权信息对语言模型按策略自蒸馏(OPSD)的影响。他们的发现表明,虽然 OPSD 可以通过为教师模型提供已解出的答案等额外信息来增强模型的学习,但实际收益适中,并且高度依赖于学生模型的训练和评估方式。研究表明,特权参考的价值更多在于促进现有推理能力的跨模态迁移,而不仅仅是揭示更多解决方案。
-
新研究推进用于LLM训练的on-policy distillation · 追踪6个来源
研究人员正在开发用于on-policy distillation (OPD) 的先进技术,这是一种用于改进大型语言模型的方法。$\\gamma$OPD和STRIDE等新方法旨在通过改进时间信用分配方式以及何时停止或重启训练来提高优化稳定性和效率。其他研究探索了无数据蒸馏,即模型生成自己的训练问题,以及SCOPE-OPSD等利用特权子空间改进自蒸馏的方法,这些方法在数学推理和代码生成等领域显示出前景。
-
VISTA方法通过师生适应性学习增强AI推理能力 · 跟踪2个来源
研究人员开发了VISTA,一种用于策略内自蒸馏(OPSD)的新方法,可增强AI模型的推理能力。与标准的OPSD不同,VISTA根据已验证的学生试运行来调整教师模型,特别关注教师模型和学生模型之间差异最大的区域。当应用于不同大小(1.7B、4B和8B参数)的Qwen3模型时,该方法在多个基准数据集(AIME24、AIME25、HMMT25)上表现出性能提升,优于现有的OPSD技术。
-
新的TTPO方法在无标签情况下增强LLM数学推理能力
研究人员开发了一种名为测试时策略优化(TTPO)的新颖方法,用于在不依赖真实标签的情况下提高大型语言模型的数学推理能力。TTPO通过采用一种不对称目标来解决使用多数投票伪标签的脆弱性,该目标会蒸馏同意的展开并惩罚不同意的展开。这种方法包括用于精炼的token级选择,在基准测试中表现出色,显著提高了Qwen3-1.7B模型的准确性,并显示出强大的跨任务泛化能力。
-
新的TTPO方法在无标签情况下增强LLM推理能力
研究人员开发了测试时策略优化(TTPO)这一新方法,可在不依赖真实标签的情况下提高大型语言模型的数学推理能力。TTPO通过采用一种区分正确预测和错误预测的不对称目标函数,解决了伪标签的脆弱性问题。这种方法实现了有效的测试时训练,在基准测试中达到了监督学习的性能水平,并显著增强了Qwen3-1.7B等模型的能力。
-
新研究改进 AI 推理模型的 On-Policy Distillation
研究人员正在探索用于训练推理模型的 On-Policy Distillation (OPD) 技术,该技术使用教师模型提供每 token 的监督。然而,OPD 的有效性和最佳配置仍不清楚,其中“崩溃”(推理路径变窄)等问题是一个重大挑战。新的方法,如 RouteOPD 和 TV-Regulated OPD,分别旨在通过显式建模概率传输和稳定训练动态来改进 OPD。一篇关键性评论还综合了现有研究,确定了 token 加权、特权信息和引导…
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…
-
新框架统一策略内自蒸馏以增强LLM推理能力 · 跟踪3个来源
研究人员开发了一个统一的策略内自蒸馏(OPSD)框架,通过将特权信息整合到模型参数中来增强LLM的推理能力。这个名为统一策略内自蒸馏(USD)的新框架,通过根据学生模型的学习能力联合优化token选择和特权信息调整,解决了先前OPSD方法的局限性。另一种名为SKALD(Skill-Anchored Latent Distillation)的方法使用抽象技能卡提供密集监督,尤其是在标准奖励信息不足时,在数学基准测试上显示出显著的改进。另…
-
新的AI训练方法使用评分标准作为开放式生成任务的特权信息
研究人员开发了一种名为On-policy self-distillation (OPSD)的新方法,该方法利用评分标准作为开放式文本生成的特权信息(PI)。该方法通过使用评分标准来指导偏好,从而增强了模型的训练信号,这比使用评分标准作为标量奖励的传统强化学习方法更有效。当应用于Qwen和Llama等模型家族时,该技术在HealthBench和ResearchQA等基准测试中表现出优越的性能,优于参考完成蒸馏和评分标准作为奖励的强化学习。
-
新方法CSCR通过重新分配Token信用来改进LLM长上下文推理
研究人员开发了一种名为反事实敏感性信用重新分配(CSCR)的新方法,以提高大型语言模型的推理能力,特别是在需要长上下文推理的任务中。该方法解决了现有强化学习技术(如GRPO和On-policy self-distillation)的局限性,这些技术经常将信用错误地归因于不太重要的Token。CSCR将信用从对结果变化高度敏感的Token重新分配,而专注于承载关键推理内容的Token。这种方法在数学推理基准测试中显示出比基线方法持续的性能改进。
-
视觉对比自蒸馏改进 Qwen VL 模型
研究人员开发了视觉对比自蒸馏(VCSD)方法,这是一种无需外部教师或特权信息即可改进视觉语言模型(VLM)的新颖方法。VCSD 通过比较模型在原始图像和内容擦除版本上的预测,并利用差异来完善模型对视觉内容的理解。该方法在各种 Qwen 模型上均显示出持续的性能提升,在不增加计算开销的情况下显著提高了基准分数。
-
新的蒸馏方法通过软提示高效训练大语言模型
研究人员开发了一种名为“通过软提示特权上下文进行多任务在线策略蒸馏”(“该方法”)的新方法来训练大语言模型。该技术使用一个仅通过可学习的软提示与学生模型不同的教师模型,从而在不改变学生模型核心参数的情况下实现高效的知识转移。多任务变体使单个学生模型能够同时从多个教师那里学习,从而提高在科学、工具使用、生物学和数学等各种任务上的性能。
-
新研究发现AI代理自蒸馏中的解码崩溃现象
研究人员在检索交错搜索代理的反馈增强自蒸馏中发现了一种失败模式,称为解码崩溃。当模型生成看似多样但与输入无关的推理和搜索输出时,就会发生这种情况,导致蒸馏信号无效。这种不稳定性源于不一致的监督信号,可以分解为模型和提示的不一致。为了解决这个问题,引入了指数移动平均(EMA)教师来稳定自教师并提高性能,尽管在其预热阶段会出现初步的回归。
-
新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力
研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略…
-
新的策略内蒸馏方法提升LLM推理能力和效率 · 跟踪10个来源
多篇研究论文探讨了语言模型策略内蒸馏(OPD)技术的进展,旨在提高推理能力和训练效率。包括SimpleOPD、S$^2$VOPD、LOPD、CROP、DAPD和REOPD在内的几种方法,引入了新颖的策略来解决分词器不匹配、特权幻觉和选择性监督等挑战。这些方法旨在提高数学推理、代码生成和细粒度感知等任务的性能,其中一些方法展示了相对于现有方法的显著提升,甚至超越了Gemini-2.5-Pro和GPT-5.4等大型模型。
-
新研究解决了大型语言模型在线策略蒸馏中的病理问题
研究人员已识别出在线策略蒸馏(OPD)中的两个关键病理问题,并提出了解决方案。OPD是大型语言模型(LLM)后训练中使用的一种技术。第一个病理问题是学生-教师模型不匹配,当教师模型和学生模型之间存在显著差距时,会导致指导失准。第二个是长度利用,当模型学会操纵响应长度以获得更高奖励时出现。为解决这些问题,引入了优势裁剪、对数尺度压缩和自适应双视角OPD(AD-OPSD)等新方法来调节蒸馏信号并保留模型的原生推理能力,在基准测试中显示出更高的准确性。
-
新研究挑战LLM的同策略自蒸馏,提出改进方法 · 跟踪10个来源
近期研究论文探讨了同策略自蒸馏(OPSD)在训练大型语言模型(LLMs)方面的局限性和潜在改进。研究表明,标准的OPSD可能导致死记硬背捷径并阻碍泛化能力,尤其是在长链推理任务中。Purified OPSD和DemoPSD等新框架旨在通过优化监督信号来解决这些问题,以防止过拟合并保留模型的推理能力。其他研究强调,虽然OPSD可以加速专业化,但它可能不足以支持持续学习,并且与其他强化学习方法相比,它可能表现出更强的遗忘效应。
-
新方法提升 VLM 在 GUI 基础任务上的准确性 · 2 篇论文
两篇新研究论文介绍了用于提高视觉语言模型 (VLM) 在 GUI 基础任务上的准确性和可靠性的新方法。第一篇论文《Trust the Right Teacher》提出了一种质量感知自蒸馏方法,通过使用正确性感知门控和概率缩放来处理不可靠的坐标-token 预测,从而优化教师信号。第二篇论文《VISTA》提出了一个视图一致性自验证训练框架,该框架利用 GUI 的多个语义等价视图来稳定强化学习并提高坐标生成准确性,在 Qwen 主干上取得…
-
新的轨迹精炼蒸馏改进了LLM训练
研究人员推出了一种新的方法——轨迹精炼蒸馏(TRD),以改进大型语言模型的训练后过程。TRD解决了在线蒸馏中的“前缀失败”问题,该问题会导致密集型逐令牌监督产生碎片化梯度。通过在蒸馏前对轨迹级别的学生模型回放进行校正,TRD缓解了这一问题并增强了探索。该方法在各种基准测试和模型规模上都显示出了一致的性能提升。
-
新的蒸馏方法在不牺牲推理能力的情况下增强了AI安全性
研究人员开发了一种名为“Constitutional On-Policy Safe Distillation”(COPSD)的新方法,以提高AI模型的安全性和有用性。现有的On-Policy自蒸馏技术可能会因为过度收缩模型响应以趋向保守输出而导致性能崩溃,尤其是在推理任务中。COPSD通过首先校准教师模型,然后进行基于高级宪法的条件蒸馏来解决这个问题,从而在不显著牺牲通用推理能力的情况下,实现更好的安全-有用性权衡。