PulseAugur
中
实时 21:18:34
实体 Multi-Teacher On-Policy Distillation

Multi-Teacher On-Policy Distillation

PulseAugur coverage of Multi-Teacher On-Policy Distillation — every cluster mentioning Multi-Teacher On-Policy Distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_245618 ·

    Video-MOPD-8B 模型通过蒸馏技术增强视频理解能力

    研究人员推出 Video-MOPD-8B,这是一款专为视频理解任务设计的新型开放权重模型。该模型利用多教师同策略蒸馏 (MOPD) 技术,通过使用教师反馈来监督学生生成的轨迹,从而整合专家知识。此外,它还采用了可靠性感知信息采样 (RAIS) 来选择具有可靠监督和教师与学生之间显著性能差距的样本。实验表明,Video-MOPD-8B 在通用理解、时间定位和推理任务等各种视频理解基准测试中取得了同等规模下的最先进性能。

  2. TOOL · CL_223215 ·

    新的MOPD方法在LLM专业化过程中保留其通用能力

    研究人员开发了一种名为不确定性校准MOPD的新方法,以解决大型语言模型在针对特定领域进行专业化时普遍存在的通用能力丧失问题。该技术通过使用双温度采样和正优势密度过滤来改进标准的Multi-Teacher On-Policy Distillation(多教师在线策略蒸馏),从而更好地选择相关的训练轨迹。实验表明,该方法在角色扮演和医疗领域分别将平均通用能力提高了4%以上和10%,同时保持了专业化性能。

  3. FRONTIER RELEASE · CL_192292 ·

    Motif Technologies 发布 314B 参数的 Motif 3 LLM

    Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性…

  4. TOOL · CL_155487 ·

    新方法Soft Clamp应对AI代理过度调用工具的问题

    研究人员在用于使用工具的AI代理的多教师在线策略蒸馏中发现了一种故障模式。该方法虽然提高了工具调用召回率,但可能导致代理不恰当地过度调用工具。该论文介绍了一种名为“Soft Clamp”的新校准技术,该技术可以动态调整token级别的散度,以减轻这种过度调用行为,同时不牺牲准确性。这种方法有助于确保代理正确地平衡工具使用与直接响应。

  5. SIGNIFICANT · CL_139795 ·

    小米的MiMo-V2-Flash凭借高效的MoE架构引领开源编码基准测试

    小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation…

  6. RESEARCH · CL_93241 ·

    Nemotron 3 Ultra:开源 LLM 拥有百万级上下文、6倍吞吐量

    研究人员发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的语言模型,它采用了混合 Mamba-Transformer 架构和专家混合(Mixture-of-Experts)方法。该模型在 20 万亿个 token 上进行了训练,拥有百万级 token 的上下文长度,并采用了 LatentMoE 和 Multi Token Prediction 等先进技术。与当前最先进的模型相比,Nemotron 3 Ultra…

  7. RESEARCH · CL_53546 ·

    新的蒸馏方法在域专业化后恢复LLM通用能力

    研究人员开发了一种名为对抗感知多教师在线策略蒸馏(CaMOPD)的新方法,以解决大型语言模型(LLM)在域专业化后恢复通用能力的挑战。现有方法在通用教师的训练数据分布未知时常常遇到困难。CaMOPD通过使用解耦的交替训练和基于差距的样本选择策略来解决这个问题。这种方法允许为通用恢复进行专门更新,定期检查域保持,并将纠正信号集中在教师-学生对数概率差距较大的样本上。实验表明,CaMOPD在通用恢复方面优于基线方法,同时在角色扮演对话和医…