PulseAugur
实时 09:16:53

新的AdaMTP范式通过自适应预测改进LLM训练

研究人员推出AdaMTP,这是一种旨在改进大型语言模型多令牌预测(MTP)的自适应训练范式。与使用固定预测范围的现有MTP框架不同,AdaMTP根据序列的可预测性动态调整预测长度,并使用基于熵的分割算法来识别语义边界。这种方法旨在减轻可能损害模型核心能力的噪声训练信号和梯度干扰。在Llama-3.1-8B、Qwen 2.5 7B和Gemma-3-12B模型上的实验表明,AdaMTP在各种基准测试中提高了性能和推理速度。 AI

影响 AdaMTP有望实现更高效、更有效的语言模型训练,提高性能和推理速度。

排序理由 该集群包含一篇详细介绍LLM新训练范式的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AdaMTP范式通过自适应预测改进LLM训练

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma ·

    AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

    arXiv:2608.00434v1 Announce Type: new Abstract: Multi-Token Prediction (MTP) has emerged as an effective paradigm that augments a shared Large Language Model backbone with auxiliary heads, training the model to predict several future tokens in parallel to enrich its supervision s…