Multi-Teacher On-Policy Distillation
PulseAugur coverage of Multi-Teacher On-Policy Distillation — every cluster mentioning Multi-Teacher On-Policy Distillation across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Motif Technologies 发布 314B 参数的 Motif 3 LLM
Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性…
-
新方法Soft Clamp应对AI代理过度调用工具的问题
研究人员在用于使用工具的AI代理的多教师在线策略蒸馏中发现了一种故障模式。该方法虽然提高了工具调用召回率,但可能导致代理不恰当地过度调用工具。该论文介绍了一种名为“Soft Clamp”的新校准技术,该技术可以动态调整token级别的散度,以减轻这种过度调用行为,同时不牺牲准确性。这种方法有助于确保代理正确地平衡工具使用与直接响应。
-
小米的MiMo-V2-Flash凭借高效的MoE架构引领开源编码基准测试
小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation…
-
Nemotron 3 Ultra:开源 LLM 拥有百万级上下文、6倍吞吐量
研究人员发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的语言模型,它采用了混合 Mamba-Transformer 架构和专家混合(Mixture-of-Experts)方法。该模型在 20 万亿个 token 上进行了训练,拥有百万级 token 的上下文长度,并采用了 LatentMoE 和 Multi Token Prediction 等先进技术。与当前最先进的模型相比,Nemotron 3 Ultra…
-
新的蒸馏方法在域专业化后恢复LLM通用能力
研究人员开发了一种名为对抗感知多教师在线策略蒸馏(CaMOPD)的新方法,以解决大型语言模型(LLM)在域专业化后恢复通用能力的挑战。现有方法在通用教师的训练数据分布未知时常常遇到困难。CaMOPD通过使用解耦的交替训练和基于差距的样本选择策略来解决这个问题。这种方法允许为通用恢复进行专门更新,定期检查域保持,并将纠正信号集中在教师-学生对数概率差距较大的样本上。实验表明,CaMOPD在通用恢复方面优于基线方法,同时在角色扮演对话和医…