PulseAugur
实时 09:26:19
实体 On-policy self-distillation

On-policy self-distillation

PulseAugur coverage of On-policy self-distillation — every cluster mentioning On-policy self-distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_183142 ·

    新的AI训练方法使用评分标准作为开放式生成任务的特权信息

    研究人员开发了一种名为On-policy self-distillation (OPSD)的新方法,该方法利用评分标准作为开放式文本生成的特权信息(PI)。该方法通过使用评分标准来指导偏好,从而增强了模型的训练信号,这比使用评分标准作为标量奖励的传统强化学习方法更有效。当应用于Qwen和Llama等模型家族时,该技术在HealthBench和ResearchQA等基准测试中表现出优越的性能,优于参考完成蒸馏和评分标准作为奖励的强化学习。

  2. TOOL · CL_179300 ·

    新方法CSCR通过重新分配Token信用来改进LLM长上下文推理

    研究人员开发了一种名为反事实敏感性信用重新分配(CSCR)的新方法,以提高大型语言模型的推理能力,特别是在需要长上下文推理的任务中。该方法解决了现有强化学习技术(如GRPO和On-policy self-distillation)的局限性,这些技术经常将信用错误地归因于不太重要的Token。CSCR将信用从对结果变化高度敏感的Token重新分配,而专注于承载关键推理内容的Token。这种方法在数学推理基准测试中显示出比基线方法持续的性能改进。

  3. RESEARCH · CL_160792 ·

    视觉对比自蒸馏改进 Qwen VL 模型

    研究人员开发了视觉对比自蒸馏(VCSD)方法,这是一种无需外部教师或特权信息即可改进视觉语言模型(VLM)的新颖方法。VCSD 通过比较模型在原始图像和内容擦除版本上的预测,并利用差异来完善模型对视觉内容的理解。该方法在各种 Qwen 模型上均显示出持续的性能提升,在不增加计算开销的情况下显著提高了基准分数。

  4. TOOL · CL_156456 ·

    新的蒸馏方法通过软提示高效训练大语言模型

    研究人员开发了一种名为“通过软提示特权上下文进行多任务在线策略蒸馏”(“该方法”)的新方法来训练大语言模型。该技术使用一个仅通过可学习的软提示与学生模型不同的教师模型,从而在不改变学生模型核心参数的情况下实现高效的知识转移。多任务变体使单个学生模型能够同时从多个教师那里学习,从而提高在科学、工具使用、生物学和数学等各种任务上的性能。

  5. TOOL · CL_154090 ·

    新研究发现AI代理自蒸馏中的解码崩溃现象

    研究人员在检索交错搜索代理的反馈增强自蒸馏中发现了一种失败模式,称为解码崩溃。当模型生成看似多样但与输入无关的推理和搜索输出时,就会发生这种情况,导致蒸馏信号无效。这种不稳定性源于不一致的监督信号,可以分解为模型和提示的不一致。为了解决这个问题,引入了指数移动平均(EMA)教师来稳定自教师并提高性能,尽管在其预热阶段会出现初步的回归。

  6. RESEARCH · CL_156464 ·

    新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力

    研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略…

  7. RESEARCH · CL_167450 ·

    新的大语言模型训练方法利用强化学习和蒸馏技术

    研究人员开发了几种新方法,利用强化学习和蒸馏技术来改进大语言模型(LLM)的训练和行为。策略梯度引导(PGS)通过将引导构建为强化学习问题,提供了一种在推理时动态改变LLM行为的方法,并在国际象棋和足球等不同领域取得了成功。Beta-OPSD($eta$-OPD)通过引入一个可控参数来概括同策略自蒸馏(OPSD),该参数平衡了与参考策略的接近程度和教师引导,从而提高了推理性能和稳定性。对比强化策略优化(CRPO)通过使用对比学习来保…

  8. RESEARCH · CL_141172 ·

    新研究解决了大型语言模型在线策略蒸馏中的病理问题

    研究人员已识别出在线策略蒸馏(OPD)中的两个关键病理问题,并提出了解决方案。OPD是大型语言模型(LLM)后训练中使用的一种技术。第一个病理问题是学生-教师模型不匹配,当教师模型和学生模型之间存在显著差距时,会导致指导失准。第二个是长度利用,当模型学会操纵响应长度以获得更高奖励时出现。为解决这些问题,引入了优势裁剪、对数尺度压缩和自适应双视角OPD(AD-OPSD)等新方法来调节蒸馏信号并保留模型的原生推理能力,在基准测试中显示出更高的准确性。

  9. RESEARCH · CL_117125 ·

    新研究挑战LLM的同策略自蒸馏,提出改进方法 · 跟踪10个来源

    近期研究论文探讨了同策略自蒸馏(OPSD)在训练大型语言模型(LLMs)方面的局限性和潜在改进。研究表明,标准的OPSD可能导致死记硬背捷径并阻碍泛化能力,尤其是在长链推理任务中。Purified OPSD和DemoPSD等新框架旨在通过优化监督信号来解决这些问题,以防止过拟合并保留模型的推理能力。其他研究强调,虽然OPSD可以加速专业化,但它可能不足以支持持续学习,并且与其他强化学习方法相比,它可能表现出更强的遗忘效应。

  10. RESEARCH · CL_90827 ·

    新方法提升 VLM 在 GUI 基础任务上的准确性 · 2 篇论文

    两篇新研究论文介绍了用于提高视觉语言模型 (VLM) 在 GUI 基础任务上的准确性和可靠性的新方法。第一篇论文《Trust the Right Teacher》提出了一种质量感知自蒸馏方法,通过使用正确性感知门控和概率缩放来处理不可靠的坐标-token 预测,从而优化教师信号。第二篇论文《VISTA》提出了一个视图一致性自验证训练框架,该框架利用 GUI 的多个语义等价视图来稳定强化学习并提高坐标生成准确性,在 Qwen 主干上取得…

  11. RESEARCH · CL_79119 ·

    新的轨迹精炼蒸馏改进了LLM训练

    研究人员推出了一种新的方法——轨迹精炼蒸馏(TRD),以改进大型语言模型的训练后过程。TRD解决了在线蒸馏中的“前缀失败”问题,该问题会导致密集型逐令牌监督产生碎片化梯度。通过在蒸馏前对轨迹级别的学生模型回放进行校正,TRD缓解了这一问题并增强了探索。该方法在各种基准测试和模型规模上都显示出了一致的性能提升。

  12. TOOL · CL_68337 ·

    新的蒸馏方法在不牺牲推理能力的情况下增强了AI安全性

    研究人员开发了一种名为“Constitutional On-Policy Safe Distillation”(COPSD)的新方法,以提高AI模型的安全性和有用性。现有的On-Policy自蒸馏技术可能会因为过度收缩模型响应以趋向保守输出而导致性能崩溃,尤其是在推理任务中。COPSD通过首先校准教师模型,然后进行基于高级宪法的条件蒸馏来解决这个问题,从而在不显著牺牲通用推理能力的情况下,实现更好的安全-有用性权衡。