一个名为MotionBlind的新基准已被开发出来,用于测试视频大语言模型(Video-LLMs)的运动理解能力。研究人员发现,大多数开源的Video-LLMs表现不佳,即使在呈现清晰的视觉数据时,也常常无法区分不同的运动速度或方向。虽然Gemini-3.1 Pro有所改进,但在准确评估速度方面仍有困难,这表明当前的Video-LLMs在需要真正理解运动的任务中尚不可靠。 AI
影响 突出了当前Video-LLMs的关键局限性,表明它们尚未适用于需要细微运动感知的应用。
排序理由 介绍用于评估Video-LLMs新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →