PulseAugur
实时 07:24:54
English(EN) VideoNorms: Benchmarking Cultural Awareness of Video Language Models

新数据集VideoNorms测试视频大语言模型的文化意识

研究人员开发了VideoNorms,一个旨在评估视频大语言模型(VideoLLMs)文化意识的新数据集。该数据集包含来自美国和中国热门电视剧的3000多条人工判断,侧重于预测文化规范的遵守或违反情况以及识别支持证据。研究结果表明,当前VideoLLMs在处理中国文化规范方面的表现不如美国文化规范,并且在识别非语言证据方面更加困难。研究还指出,虽然视频模态至关重要,但仅仅扩大模型规模并不一定能提高在此任务上的性能。 AI

影响 强调了对具有文化意识的AI进行训练和评估的必要性,可能指导未来开发更具全球适用性的VideoLLMs。

排序理由 该集群是关于一篇介绍新数据集和评估AI模型基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新数据集VideoNorms测试视频大语言模型的文化意识

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan ·

    VideoNorms:对视频语言模型文化意识的基准测试

    arXiv:2510.08543v2 Announce Type: replace-cross Abstract: As Video Large Language Models (VideoLLMs) are deployed globally, it is important to assess their ability to reason across cultural contexts. To advance cultural norm awareness evaluation in VideoLLMs, we introduce VideoNo…