一个名为ViSTR-Bench的新基准被引入,用于评估多模态大语言模型(MLLMs)的空间-时间推理能力。该基准侧重于从动态场景的连续视觉线索中进行定性推理,弥补了现有评估通常关注静态场景或需要精确量化预测的不足。ViSTR-Bench包含15个子任务和1300多个视频问答对,评估运动感知、空间关系、结果预测和物理动力学。初步评估显示,当前最先进的MLLMs在复杂空间-时间推理方面仍远落后于人类表现。 AI
影响 该基准有望推动MLLMs理解和推理动态现实世界环境的能力的提升,这对于需要实时交互的应用至关重要。
排序理由 该项目是一篇研究论文,介绍了一个用于评估AI模型的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →