研究人员开发了一种新方法,可以从未能完成推理任务的大型语言模型 (LLM) 中恢复正确答案。该技术解决了“表达失败”问题,即模型拥有潜在的推理能力,但由于结构偏差而难以正确输出。通过在无标签示例上仅拟合两个参数,该方法可以将 Qwen3.5 等模型的准确率提高 9-34 个百分点,并且对 OLMo-2-1B 和 Llama-3.1-8B 也有效。 AI
影响 这项研究表明,许多 LLM 的推理失败可能归因于输出表达问题,而非能力不足,这可能会改变对 LLM 性能的基准测试和解读方式。
排序理由 该集群包含一篇学术论文,详细介绍了一种评估 LLM 推理能力的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →