研究人员推出了 LEGO Co-builder,这是一个新的基准,旨在测试人工智能模型在解释多模态组装说明时的细粒度视觉语言理解能力。该基准结合了真实世界的乐高组装逻辑和程序生成场景,以评估指令遵循、物体检测和状态检测。虽然 InstructBLIP 等模型在物体检测方面取得了高性能,但 GPT-4o 和 Gemini 等先进模型在细粒度场景理解和组装状态检测方面遇到了困难,凸显了这些领域的当前局限性。 AI
影响 突显了当前视觉语言模型在复杂、细粒度的空间推理和状态检测方面存在的显著差距,可能指导未来的研究。
排序理由 该集群描述了一篇介绍用于评估人工智能模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →