研究人员推出了TAKE 85,这是一个旨在评估多模态大语言模型(MLLMs)在多大程度上能理解电影中导演意图的新基准。该基准包含398部短片,总时长85小时,并附有专家验证的问答对,涵盖了视觉和听觉意图的广泛和具体方面。目前最先进的MLLMs在该领域显示出显著的差距,它们能准确描述事件,但无法推断电影制作决策背后的沟通目的。即使是表现最好的模型也只得到了100分中的58分,这表明没有单一的输入模态足以理解导演意图。 AI
影响 该基准突显了MLLM能力的一个关键差距,推动了在理解超越简单事件识别的细微沟通方面的进步。
排序理由 该集群引入了一个评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →