研究人员推出了NARU,这是一个新的基准,旨在评估多模态大语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含1,481个问题,源自155个视频,总时长超过146小时,评估四个叙事维度和五个文化维度。NARU通过一个涉及母语者的分层标注流程开发,旨在识别当前MLLMs处理复杂、高语境视频内容能力的局限性。 AI
影响 该基准旨在提高AI理解复杂、具有文化细微差别的长视频内容的能力。
排序理由 该集群描述了一个用于评估AI模型在特定类型数据(日语长视频)上表现的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →