PulseAugur
实时 08:37:30
English(EN) ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

新的ViSTR-Bench评估多模态大语言模型动态场景推理能力

一个名为ViSTR-Bench的新基准被引入,用于评估多模态大语言模型(MLLMs)的空间-时间推理能力。该基准侧重于从动态场景的连续视觉线索中进行定性推理,弥补了现有评估通常关注静态场景或需要精确量化预测的不足。ViSTR-Bench包含15个子任务和1300多个视频问答对,评估运动感知、空间关系、结果预测和物理动力学。初步评估显示,当前最先进的MLLMs在复杂空间-时间推理方面仍远落后于人类表现。 AI

影响 该基准有望推动MLLMs理解和推理动态现实世界环境的能力的提升,这对于需要实时交互的应用至关重要。

排序理由 该项目是一篇研究论文,介绍了一个用于评估AI模型的新基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ViSTR-Bench评估多模态大语言模型动态场景推理能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang ·

    ViSTR-Bench:多模态大模型能否从动态场景中的连续视觉线索进行推理?

    arXiv:2607.20868v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) have achieved remarkable success across diverse expert-level tasks, but they still struggle with fundamental abilities that humans naturally develop through continuous observation of the real…