研究人员推出了图像消歧视频时序定位(ID-VTG)这一新任务,旨在提高在仅凭文本查询不足时,在视频中定位特定事件的能力。该方法结合参考图像和文本描述,来精确定位特定实例执行描述动作的片段。为了支持该任务,创建了两个基准测试集:IDVTG-Gym和IDVTG-InternVid,它们包含具有相似实体和时间干扰因素的复杂场景。提出的视觉引导消歧聚合(VGD-Agg)框架采用双分支架构,以高效生成和优化事件提案,并取得了最先进的成果。 AI
影响 这项研究可以提高AI系统在理解和定位视频事件方面的精度,尤其是在复杂场景下。
排序理由 该集群包含一篇详细介绍计算机视觉新任务、基准测试和方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Compare Token
- Depress Value
- ID-VTG
- IDVTG-Gym
- IDVTG-InternVid
- Image-Disambiguated Video Temporal Grounding
- Video Temporal Grounding
- Visually-Guided Disambiguation Aggregation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →