研究人员开发了一种名为掩码边界暂停(MBP)的新方法,以提高大型语言模型(LLM)的推理能力。该技术涉及在推理步骤边界策略性地放置暂停标记,并在训练期间掩盖其损失。在Qwen和Llama模型上的实验表明,MBP可以将数学和代码推理分别提高多达6分和2.5分,同时保持通用的语言理解能力。该方法还将收益扩展到GRPO模型,表明暂停标记可以被视为一种训练动态干预,而不仅仅是推理时工具。 AI
影响 这项研究引入了一种新颖的训练技术,可能带来更强大的LLM来处理复杂的推理任务。
排序理由 该集群包含一篇学术论文,详细介绍了一种改进LLM推理的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →