研究人员推出PBEBench,一个新颖的基准,旨在通过借鉴历史语言学的灵感来评估大型语言模型(LLMs)的归纳推理能力。该基准向LLMs呈现一项任务,要求它们生成一系列字符串重写程序,将输入字符串转换为所需的输出字符串,这模仿了历史语言学中的正向重构过程。使用PBEBench及其更简单的变体PBEBench-Lite进行的实验表明,利用大量计算或长链式思考推理的模型与不使用这些技术的模型之间存在显著的性能差距。即使采用先进技术,当前模型在PBEBench的复杂实例上仍面临挑战,未能达到现实历史语言学场景的要求。 AI
影响 该基准可能带来对LLM推理更鲁棒的评估,并可能推动其处理复杂、多步任务能力的提升。
排序理由 该集群包含一篇介绍用于评估LLM推理能力的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →