一个名为 TriViewBench 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的结构推理能力。该基准包含具有不同物体数量和遮挡的合成 3D 场景,结果显示所有 18 个经过评估的 MLLMs 都表现出一致的性能层级,随着复杂度的增加,能力会显著下降。具体而言,全局恢复任务严重崩溃,物体计数也显示出显著的退化。研究表明,当前 MLLMs 在跨视角空间表示方面面临根本性的可扩展性限制,而思维链提示(Chain-of-Thought prompting)的好处甚微。 AI
影响 突出了多模态大语言模型在复杂视觉推理方面可扩展性的根本局限性,可能指导未来的模型开发。
排序理由 该集群包含一篇介绍用于评估 AI 模型的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →