一个名为 LEGO-Puzzles 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的多步空间推理能力。研究人员发现,即使是最先进的 MLLMs 在基本空间理解和规划任务上也表现不佳,其表现远逊于人类。随着空间推理所需复杂性和步骤的增加,这些模型的性能会迅速下降,凸显了它们当前能力的重大局限性。 AI
影响 凸显了当前 MLLMs 在空间推理方面的重大局限性,表明需要架构上的进步来处理复杂的多步任务。
排序理由 该集群包含两篇学术论文,介绍了用于评估多模态大语言模型空间推理能力的新基准。
在 Hugging Face Daily Papers 阅读 →
- Hugging Face
- Kexian Tang
- LEGO-Puzzles
- MLLMs
- visual question answering
- GPT-5.5
- JigShape
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →