研究人员推出了VidNum-1.4K,这是一个旨在利用视频数据测试视觉语言模型(VLM)数值推理能力的新基准。该基准包含1,379个视频-问题对,需要基于时间证据的多步数值逻辑、算术运算和比较。评估显示,包括Gemini-3.1 Pro在内的当前最先进的VLM在此任务上表现困难,突显了它们在为视频理解开发强大的内部世界模型方面存在重大差距。 AI
影响 强调了当前VLM在视频中进行复杂数值推理能力方面的关键差距,表明需要改进内部世界模型。
排序理由 该项目是一篇介绍新AI模型评估基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →