研究人员推出了ShotFinder,这是一个旨在评估大型语言模型开放域视频片段检索能力的新基准。该基准将编辑需求形式化为面向关键帧的片段描述,并包含五种可控约束:时间顺序、颜色、视觉风格、音频和分辨率。从YouTube收集了1,210个样本的数据集,并提出了一个三阶段检索和定位流程。实验表明,当前模型与人类能力之间存在显著的性能差距,其中颜色和视觉风格对多模态大型模型构成了最大的挑战。 AI
影响 凸显了多模态大语言模型在复杂视频编辑任务中的当前局限性,指出了未来研究和发展的方向。
排序理由 该项目描述了一个新的基准和相关论文,用于评估AI在视频片段检索方面的能力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →