研究人员开发了一个新的基准来测试大型语言模型(LLM)的分布外(OOD)推理能力。他们的评估表明,即使是前沿模型,当前的LLM在问题深度增加时,推理准确性也会显著下降。然而,研究表明,通过工具使用使LLM能够合成、执行和改进代码,可以克服这一限制,使较小的模型在复杂的、长期的推理任务上能够媲美前沿模型的性能。 AI
影响 工具使用对于开发能够进行稳健的、长期的推理和泛化的LLM至关重要。
排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了新的基准和关于LLM推理能力的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →