研究人员推出了VideoGAIA,这是一个旨在评估多模态大语言模型(MLLMs)在智能体视频理解方面能力的新基准。与侧重于单轮问答的先前基准不同,VideoGAIA要求模型进行多轮交互、利用外部工具并整合信息。这种先进的方法是必要的,因为目前领先的模型在更简单的任务上已接近饱和,在Video-MME等基准上准确率超过90%。初步评估表明,即使是GPT-5.5和Kimi-K3等前沿模型在VideoGAIA上也表现不佳,准确率低于60%,这表明其在评估下一代MLLMs方面的有效性。 AI
影响 该基准旨在通过评估AI助手理解复杂、多轮视频交互的能力来推动更强大AI助手的开发。
排序理由 该集群描述了一个用于评估AI模型的新学术基准,发布在arXiv上。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →