PulseAugur
实时 06:45:03

新的ID-VTG任务通过图文查询增强视频时序定位

研究人员推出了图像消歧视频时序定位(ID-VTG)这一新任务,旨在提高在仅凭文本查询不足时,在视频中定位特定事件的能力。该方法结合参考图像和文本描述,来精确定位特定实例执行描述动作的片段。为了支持该任务,创建了两个基准测试集:IDVTG-Gym和IDVTG-InternVid,它们包含具有相似实体和时间干扰因素的复杂场景。提出的视觉引导消歧聚合(VGD-Agg)框架采用双分支架构,以高效生成和优化事件提案,并取得了最先进的成果。 AI

影响 这项研究可以提高AI系统在理解和定位视频事件方面的精度,尤其是在复杂场景下。

排序理由 该集群包含一篇详细介绍计算机视觉新任务、基准测试和方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ID-VTG任务通过图文查询增强视频时序定位

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu ·

    ID-VTG:图像消歧视频时序定位

    arXiv:2608.20127v1 Announce Type: new Abstract: Video Temporal Grounding (VTG) faces significant challenges when natural language queries must distinguish between multiple events involving visually similar entities, particularly when relying on fine-grained visual attributes that…