PulseAugur
实时 03:16:47
English(EN) VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning

新的VidNum-1.4K基准揭示VLM在视频数值推理方面存在困难

研究人员推出了VidNum-1.4K,这是一个旨在利用视频数据测试视觉语言模型(VLM)数值推理能力的新基准。该基准包含1,379个视频-问题对,需要基于时间证据的多步数值逻辑、算术运算和比较。评估显示,包括Gemini-3.1 Pro在内的当前最先进的VLM在此任务上表现困难,突显了它们在为视频理解开发强大的内部世界模型方面存在重大差距。 AI

影响 强调了当前VLM在视频中进行复杂数值推理能力方面的关键差距,表明需要改进内部世界模型。

排序理由 该项目是一篇介绍新AI模型评估基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的VidNum-1.4K基准揭示VLM在视频数值推理方面存在困难

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He ·

    VidNum-1.4K:一个用于视频数值推理的综合基准测试

    arXiv:2604.03701v4 Announce Type: replace Abstract: Video-based numerical reasoning provides a premier arena for testing whether Vision-Language Models (VLMs) truly "understand" real-world dynamics, as accurate numerical deduction necessitates a profound grasp of temporal events,…