PulseAugur
中
实时 21:32:20
实体 FLNA

FLNA

PulseAugur coverage of FLNA — every cluster mentioning FLNA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 11 条
  1. RESEARCH · CL_235470 ·

    新研究论文详细介绍了用于增强LLM推理能力的OPD-then-RL方法

    一篇新研究论文提出了一个名为OPD-then-RL的两阶段方法,用于提高大型语言模型的推理能力。该方法结合了On-Policy Distillation (OPD) 和 Reinforcement Learning with Verifiable Rewards (RLVR),首先使用OPD进行广泛覆盖,然后应用RLVR进行精炼。实验表明,这种顺序策略在逻辑和数学推理基准测试中优于联合优化方法。

  2. RESEARCH · CL_229082 ·

    新蒸馏方法提升AI模型多样性迁移能力

    研究人员推出了一种名为Influence-Directed Adaptive On-Policy Distillation (IDA-OPD)的新方法,以解决语言模型中多样性蒸馏失败的问题。该技术旨在改进学生模型继承教师模型多样性的方式,这是一个常见问题,即学生模型在单Token预测上的性能有所提升,但其整体多样性却停滞不前。IDA-OPD通过分析模型更新的熵效应,选择性地保留有益的更新并修改有害的更新来实现这一点,而且无需教师模型的…

  3. RESEARCH · CL_179156 ·

    深入解析:RL和策略蒸馏在LLM训练中的应用

    一篇关于用于训练大型语言模型(LLM)的强化学习(RL)和策略蒸馏(OPD)的深度解析已发布,详细介绍了这些算法的数学和编码方面。内容旨在阐明这些技术如何与预训练和监督微调联系起来,并与Kimi、DS、Qwen和GLM等前沿模型进行类比。该资源包含一个YouTube视频以供进一步解释和讨论。

  4. MEME · CL_176815 ·

    Reddit用户寻求消费级GPU上OPD/OPSD与GRPO算法的实现

    Reddit的r/MachineLearning板块的一位用户正在寻找学习On Policy Distillation (OPD)和On Policy Self Distillation (OPSD)算法的资源。他们特别关注这些方法与GRPO的对比,并正在寻找可以在Nvidia RTX 4090或5090等消费级GPU上运行的GitHub仓库或关于合适SLM和数据集的指导。

  5. RESEARCH · CL_180478 ·

    新方法RSTG通过自适应教师指导改进LLM强化学习

    研究人员开发了RSTG(Recovering Learning Signals via Adaptive Teacher Guidance,通过自适应教师指导恢复学习信号),一种改进大型语言模型强化学习的新方法。现有的GRPO等方法在稀疏奖励方面存在困难,而与在线蒸馏(OPD)的简单组合可能会降低性能。RSTG选择性地将蒸馏应用于负面提示,根据教师的置信度对样本进行加权,并针对特定标记进行蒸馏。它还通过注入正梯度来纳入教师生成的轨迹上…

  6. RESEARCH · CL_147422 ·

    新的On-Policy Delta Distillation方法增强了LLM的推理能力

    研究人员引入了一种名为On-Policy Delta Distillation (OPD^2) 的新方法,以提高大型语言模型中推理能力的迁移。该技术利用“delta信号”(表示指令微调前教师模型与其基础模型之间的差异)来提供更直接的监督。在数学、科学和代码推理任务上的实验表明,OPD^2 的性能显著优于传统的on-policy distillation,使得LLM能够以最小的训练后调整实现强大的推理性能。

  7. RESEARCH · CL_152127 ·

    新的蒸馏方法增强了多模态AI的推理能力

    研究人员开发了新的策略内蒸馏技术,以改进多模态AI模型。OPOD方法将学生响应路由到特定模态的教师,在各种基准测试中取得了最先进的成果。对比策略内蒸馏(COPD)和策略内增量蒸馏(OPD^2)分别通过关注相对推理兼容性和指令调优的增量信号,进一步改进了这一点,从而实现了更高效、更强大的模型。

  8. RESEARCH · CL_128357 ·

    新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源

    研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…

  9. TOOL · CL_139335 ·

    Trust Region Policy Distillation 增强了 AI 训练的稳定性

    研究人员推出了一种名为 Trust Region Policy Distillation (TOP-D) 的新方法,旨在稳定通常不稳定的 On-Policy Distillation (OPD) 训练过程。TOP-D 通过动态创建一个近端教师模型来实现这一点,该模型理论上可以控制梯度方差并提供正式的全局收敛分析。在实践中,TOP-D 在不引入任何额外计算开销的情况下,在训练稳定性、样本效率和数学推理任务的性能方面都取得了改进。

  10. RESEARCH · CL_115157 ·

    Qwen-Image-2.0-RL 通过 RLHF 和蒸馏增强扩散模型

    研究人员开发了 Qwen-Image-2.0-RL,这是一个新的管线,用于增强 Qwen-Image-2.0 扩散模型在图像生成和编辑方面的能力。该管线利用来自人类反馈的强化学习 (RLHF) 和 on-policy 蒸馏 (OPD) 来提高视觉质量和指令遵循能力。该系统采用了文本到图像和图像编辑任务的复合奖励模型,其中包含对齐、美学和人脸身份保留等要素。评估显示,与基础模型相比,在美学质量、提示遵循度和编辑准确性方面都有显著提升。

  11. RESEARCH · CL_91199 ·

    在线策略蒸馏更新被发现稀疏且几何特征独特

    一篇新的研究论文探讨了在线策略蒸馏(OPD)的机制,这是一种结合在线策略学生轨迹和密集教师监督的训练后技术。研究表明,OPD更新很小且在坐标上是稀疏的,主要影响前馈网络(FFN)模块。这种稀疏性是有功能的,因为仅训练识别出的子网络即可接近完全训练的性能。此外,研究表明,虽然更新在数值上是满秩的,但它们在频谱上是集中的,并且与原始权重的秩主奇异子空间不一致,这表明OPD保留了在线策略训练后编辑的独特几何特性,而不是作为标准的密集参数重写。