研究人员推出AdaMTP,这是一种旨在改进大型语言模型多令牌预测(MTP)的自适应训练范式。与使用固定预测范围的现有MTP框架不同,AdaMTP根据序列的可预测性动态调整预测长度,并使用基于熵的分割算法来识别语义边界。这种方法旨在减轻可能损害模型核心能力的噪声训练信号和梯度干扰。在Llama-3.1-8B、Qwen 2.5 7B和Gemma-3-12B模型上的实验表明,AdaMTP在各种基准测试中提高了性能和推理速度。 AI
影响 AdaMTP有望实现更高效、更有效的语言模型训练,提高性能和推理速度。
排序理由 该集群包含一篇详细介绍LLM新训练范式的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AdaMTP
- arXiv
- Gemma-3-12B
- Hugging Face
- large language model
- Llama-3.1:8b
- Multi Token Prediction
- Qwen 2.5 7B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →