研究人员推出了HeiCo-FOCUS,一个旨在评估视觉语言模型(VLMs)长上下文视频理解能力的新数据集。该数据集源自海德堡结直肠手术,专注于在可能持续数小时的手术过程中跟踪异物的挑战。HeiCo-FOCUS包含30,000个视觉问答对,并采用多轨道评估框架,逐步测试模型在物体识别、时间定位、聚合、事件理解和复杂推理方面的能力。对十个前沿VLMs进行的初步实验揭示了重大挑战,尤其是在时间定位方面,表明当前模型距离掌握这项复杂任务还有很长的路要走。 AI
影响 该数据集旨在推动能够进行持续时间推理的VLMs的发展,这对于短内容以外的应用至关重要。
排序理由 该条目描述了一个用于长上下文视频理解的新数据集和评估框架,发表在一篇学术论文中。
- alphaXiv
- CatalyzeX
- DagsHub
- Foreign Object Contextual Understanding in Surgery
- Gotit.pub
- HeiCo-FOCUS
- Heidelberg
- Heidelberg Colorectal surgeries
- Hugging Face
- ScienceCast
- vision-language model
- visual question answering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →