PulseAugur
实时 11:54:02
English(EN) NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

新的NARU基准测试MLLMs对日语视频叙事和文化的理解能力

研究人员推出了NARU,这是一个新的基准,旨在评估多模态大型语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含基于155个视频的1,481个问题,总时长为146.8小时,涵盖了四个叙事维度和五个文化维度。其构建过程采用了基于分层记忆的注释流程,并由68名母语为日语的注释员进行了验证。初步评估表明,当前MLLMs在长距离叙事整合和基于文化的推理方面存在显著局限性。 AI

影响 NARU基准突显了MLLMs在理解长视频中复杂叙事和文化背景方面的关键差距。

排序理由 该集群描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的NARU基准测试MLLMs对日语视频叙事和文化的理解能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma ·

    NARU:日语极端长视频中的叙事演变与文化细微差别理解基准

    arXiv:2608.13210v1 Announce Type: cross Abstract: Long-form video understanding encompasses tasks that go beyond retrieving isolated events, including tracking an evolving narrative and interpreting social meaning that may remain implicit. However, existing benchmarks rarely eval…