研究人员推出了MMGR,这是一个新的基准,旨在评估多模态生成模型在视频、图像和语言输出方面的推理能力。该基准在抽象推理、具身导航和物理常识等领域的十项任务中,评估了五种关键的推理能力:物理、逻辑、二维空间、三维空间和时间。对最先进模型的初步评估显示,视觉输出质量与实际推理正确性之间存在显著差距,模型在数独和数学等符号任务上表现不佳,在导航任务中表现脆弱。 AI
影响 该基准旨在将AI评估从视觉真实性转向实际问题解决,推动多模态模型实现更强大的推理能力。
排序理由 该集群描述了一个新的多模态生成模型基准和评估,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →