研究人员推出TangramPuzzle,一个旨在评估多模态大语言模型(MLLMs)组合空间推理能力的新基准测试。该基准测试包含668个配置和1,336个实例,以严格测试几何约束和构建任务中的多个有效解决方案。初步评估表明,当前的多模态大语言模型常常优先匹配目标轮廓而非遵守精确的几何规则,导致图形碎片化。 AI
影响 该基准测试有望推动多模态大语言模型在理解和生成复杂空间布局方面的能力提升,这对于涉及机器人、设计和增强现实的任务至关重要。
排序理由 该集群描述了一个评估多模态大语言模型的新基准测试和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →