研究人员开发了 PuzzleMate,这是一个新的框架和基准,旨在评估多模态大语言模型(MLLMs)在提供复杂物理任务的循序渐进指导方面的能力,以拼图为例。研究揭示了包括 GPT-5.2 和 Gemini 2.5 Pro 在内的当前最先进的 MLLMs 存在显著局限性,指出了阻碍它们进行精确空间推理和顺序逻辑能力的七个关键瓶颈。研究结果表明存在巨大的性能差距,这表明尽管这些模型在一般视觉理解方面表现出色,但它们在以自我为中心的拼图辅助所需的复杂推理方面却举步维艰。 AI
影响 强调了当前多模态大语言模型在现实世界、循序渐进指导方面的局限性,表明 AI 助手需要改进推理能力。
排序理由 该集群包含一篇详细介绍新基准和现有模型评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →