研究人员推出 DVBench,这是一个旨在评估多模态大语言模型(MLLM)理解数据视频能力的新基准测试。这些视频结合了动态图表和叙事元素,这是现有评估未能充分涵盖的能力。DVBench 包含 300 个真实世界的数据视频和 1000 个问答对。在对九个 MLLM 的评估中,Gemini-3.1 Pro 展现了最高的整体性能,而 Kimi-k2.5 在开源模型中领先。研究还指出,开源模型的性能并不总是与参数量相关,并且叙事能力并不总是能转化为视觉理解能力。 AI
影响 该基准测试有望推动 LLM 在解释复杂视觉和时间数据方面的能力改进,这对于数据分析和沟通至关重要。
排序理由 该集群描述了一个用于评估 AI 模型的新学术基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →