研究人员推出了NARU,这是一个新的基准,旨在评估多模态大型语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含基于155个视频的1,481个问题,总时长为146.8小时,涵盖了四个叙事维度和五个文化维度。其构建过程采用了基于分层记忆的注释流程,并由68名母语为日语的注释员进行了验证。初步评估表明,当前MLLMs在长距离叙事整合和基于文化的推理方面存在显著局限性。 AI
影响 NARU基准突显了MLLMs在理解长视频中复杂叙事和文化背景方面的关键差距。
排序理由 该集群描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →