PulseAugur
实时 04:49:38
实体 FLNA

FLNA

PulseAugur coverage of FLNA — every cluster mentioning FLNA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. MEME · CL_176815 ·

    Reddit用户寻求消费级GPU上OPD/OPSD与GRPO算法的实现

    Reddit的r/MachineLearning板块的一位用户正在寻找学习On Policy Distillation (OPD)和On Policy Self Distillation (OPSD)算法的资源。他们特别关注这些方法与GRPO的对比,并正在寻找可以在Nvidia RTX 4090或5090等消费级GPU上运行的GitHub仓库或关于合适SLM和数据集的指导。

  2. RESEARCH · CL_147422 ·

    新的On-Policy Delta Distillation方法增强了LLM的推理能力

    研究人员引入了一种名为On-Policy Delta Distillation (OPD^2) 的新方法,以提高大型语言模型中推理能力的迁移。该技术利用“delta信号”(表示指令微调前教师模型与其基础模型之间的差异)来提供更直接的监督。在数学、科学和代码推理任务上的实验表明,OPD^2 的性能显著优于传统的on-policy distillation,使得LLM能够以最小的训练后调整实现强大的推理性能。

  3. RESEARCH · CL_152127 ·

    新的蒸馏方法增强了多模态AI的推理能力

    研究人员开发了新的策略内蒸馏技术,以改进多模态AI模型。OPOD方法将学生响应路由到特定模态的教师,在各种基准测试中取得了最先进的成果。对比策略内蒸馏(COPD)和策略内增量蒸馏(OPD^2)分别通过关注相对推理兼容性和指令调优的增量信号,进一步改进了这一点,从而实现了更高效、更强大的模型。

  4. RESEARCH · CL_128357 ·

    新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源

    研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…

  5. TOOL · CL_139335 ·

    Trust Region Policy Distillation 增强了 AI 训练的稳定性

    研究人员推出了一种名为 Trust Region Policy Distillation (TOP-D) 的新方法,旨在稳定通常不稳定的 On-Policy Distillation (OPD) 训练过程。TOP-D 通过动态创建一个近端教师模型来实现这一点,该模型理论上可以控制梯度方差并提供正式的全局收敛分析。在实践中,TOP-D 在不引入任何额外计算开销的情况下,在训练稳定性、样本效率和数学推理任务的性能方面都取得了改进。

  6. RESEARCH · CL_115157 ·

    Qwen-Image-2.0-RL 通过 RLHF 和蒸馏增强扩散模型

    研究人员开发了 Qwen-Image-2.0-RL,这是一个新的管线,用于增强 Qwen-Image-2.0 扩散模型在图像生成和编辑方面的能力。该管线利用来自人类反馈的强化学习 (RLHF) 和 on-policy 蒸馏 (OPD) 来提高视觉质量和指令遵循能力。该系统采用了文本到图像和图像编辑任务的复合奖励模型,其中包含对齐、美学和人脸身份保留等要素。评估显示,与基础模型相比,在美学质量、提示遵循度和编辑准确性方面都有显著提升。

  7. RESEARCH · CL_91199 ·

    在线策略蒸馏更新被发现稀疏且几何特征独特

    一篇新的研究论文探讨了在线策略蒸馏(OPD)的机制,这是一种结合在线策略学生轨迹和密集教师监督的训练后技术。研究表明,OPD更新很小且在坐标上是稀疏的,主要影响前馈网络(FFN)模块。这种稀疏性是有功能的,因为仅训练识别出的子网络即可接近完全训练的性能。此外,研究表明,虽然更新在数值上是满秩的,但它们在频谱上是集中的,并且与原始权重的秩主奇异子空间不一致,这表明OPD保留了在线策略训练后编辑的独特几何特性,而不是作为标准的密集参数重写。