PulseAugur
实时 15:45:02
English(EN) Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation

新研究详解用于LLM预训练的策略外蒸馏

研究人员探索了大型语言模型预训练中策略外蒸馏的复杂性,这项技术现已成为该领域的中心。他们的研究将该过程分解为两个关键分析:训练目标如何塑造令牌级监督和模型能力,以及数据异质性应如何指导目标路由。研究结果表明,由于直接强化和教师支持的监督之间存在梯度张力,标准的语言建模目标和知识蒸馏目标产生了不同的能力特征。自适应目标路由,即将不同的目标应用于特定数据域(如数学/代码)与通用文本,显示出相对于单一目标方法的持续收益。 AI

影响 提供了对策略外蒸馏的更深入理解,有望带来更高效、更有效的LLM预训练策略。

排序理由 该集群包含一篇详细介绍LLM预训练新技术的新颖研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究详解用于LLM预训练的策略外蒸馏

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jiangan Yuan, Zhixuan Li, Han Xu ·

    让数据说话:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由

    arXiv:2607.16246v1 Announce Type: cross Abstract: Off-policy distillation is now central to large language model pre-training, yet how training data, objective parameterization, and model capabilities interact remains poorly characterized. We studies top-$k$-truncated, temperatur…