研究人员开发了一种新的语言模型多令牌预测(MTP)训练后方法,与传统的联合训练相比,显著降低了计算成本。该技术允许一个固定的推理模型在数学和编码等基准测试上,使用少得多的训练令牌,实现相当或甚至更好的吞吐量速度。该方法包括对草稿令牌验证规则进行链式感知松弛,以允许从骨干分布中有限的漂移,以及一个自适应控制器,在推理过程中动态调整MTP头的数量,恢复速度损失。 AI
影响 这项研究可能通过降低实现高生成吞吐量所需的计算要求,从而实现更高效的大语言模型部署。
排序理由 关于语言模型多令牌预测新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →