研究人员推出了 TAR(交通异常推理)和 TAR-Bench,这是一个新的数据集和基准,旨在推动视频语言模型超越简单的异常检测。TAR 包含来自 3,670 个 CCTV 视频的 10 个任务的超过 44,000 个链式思考注释,利用 MAVEN 系统进行结构化事件描述和推理跟踪。TAR-Bench 是评估组件,包含 80 个视频剪辑的 960 个人工策划的测试注释。在 TAR-Bench 上的初步评估表明,强大的问答能力并不一定与当前视觉语言模型稳健的时间或场景推理能力相关。在 TAR 数据集上进行多任务微调显示出显著的改进,一个在所有 10 个任务上训练的模型比其零样本基线提高了 21.4 个总分。 AI
影响 该数据集和基准旨在推动视频语言模型实现更复杂的推理能力,有可能改善其在交通监控等复杂现实场景中的应用。
排序理由 该集群描述了一篇介绍用于人工智能研究的数据集和基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →