研究人员开发了一种新颖的自监督训练方法,可以在不明确优化输出长度的情况下提高大语言模型的推理效率。通过训练模型预测其在推理中间步骤中答案的置信度,模型学会生成更简洁的推理过程。该方法应用于 Gemma、Qwen、Nemotron 和 GPT-OSS 等模型,在各种基准测试中将 token 生成量减少了高达 25%,同时保持了准确性。研究结果表明,置信度等元认知信号可以作为副产品带来高效推理,而无需直接优化长度。 AI
影响 这种方法有可能通过减少 token 生成量而不牺牲准确性,从而实现更具成本效益的大语言模型推理。
排序理由 详细介绍大语言模型新训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →