PulseAugur
实时 11:59:02
实体 Video Temporal Grounding

Video Temporal Grounding

PulseAugur coverage of Video Temporal Grounding — every cluster mentioning Video Temporal Grounding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_245637 ·

    新的IAE-VTG方法改进了动作-实体视频时间定位

    研究人员推出了一种新颖的视频时间定位(VTG)方法IAE-VTG,该方法专门处理涉及实体执行动作的查询。与以往整体处理查询的方法不同,IAE-VTG将查询中的动作和实体信息解耦,以更好地与互补的视频特征对齐。这是通过细粒度解耦交互模块(FDIM)和交互敏感分配(ISA)训练策略实现的,该策略通过考虑时间重叠和语义兼容性来提高时间定位的准确性。在QVHighlights、Charades-STA和TACoS等基准数据集上的实验表明,IA…

  2. TOOL · CL_212194 ·

    新的ID-VTG任务通过图文查询增强视频时序定位

    研究人员推出了图像消歧视频时序定位(ID-VTG)这一新任务,旨在提高在仅凭文本查询不足时,在视频中定位特定事件的能力。该方法结合参考图像和文本描述,来精确定位特定实例执行描述动作的片段。为了支持该任务,创建了两个基准测试集:IDVTG-Gym和IDVTG-InternVid,它们包含具有相似实体和时间干扰因素的复杂场景。提出的视觉引导消歧聚合(VGD-Agg)框架采用双分支架构,以高效生成和优化事件提案,并取得了最先进的成果。

  3. TOOL · CL_180527 ·

    新的CAVE方法将视觉证据与视频时间戳对齐

    研究人员推出了一种名为CAVE(Competence-Aware Visual Boundary Evidence Alignment)的新方法,以改进大型视觉-语言模型中的视频时间定位。CAVE通过引入特定边界的视觉证据奖励,解决了视觉证据与预测时间戳之间普遍存在的错位问题。该方法使用专门的证据令牌和强化学习来增强视觉注意力与时间边界之间的对齐,并在多个基准测试中证明了其有效性。

  4. RESEARCH · CL_50751 ·

    EVIDENT框架通过实体级证据增强MLLM视频定位能力

    研究人员推出EVIDENT,一个旨在提高多模态大模型(MLLM)在视频时序定位任务中性能的新框架,尤其是在面对领域迁移时。EVIDENT通过显式的视觉实体证据进行适配,将时序定位锚定在MLLM固有的实体注意力能力上。该框架包含一个实体瓶颈适配器、一个实体绑定蒸馏损失和一个实体到证据的门控机制,以确保微调依赖于实体关联的证据,而非脆弱的数据集捷径。实验表明,EVIDENT在保持具有竞争力的领域内性能的同时,通过最小的参数开销提高了跨领域…

  5. RESEARCH · CL_40792 ·

    AI研究解决自动驾驶汽车和视频分析中的时间接地问题

    两篇新研究论文探讨了改进AI系统时间接地的方法,特别是在自动驾驶汽车和视频分析领域。第一篇论文《从提示到路面,穿越时间》(From Prompts to Pavement Through Time)研究了自动驾驶汽车中Agent通信的时间条件,发现虽然它改变了推理,但并未显著提高标准指标,却在危险预测方面显示出定性优势。第二篇论文《Foresee-to-Ground》提出了一个用于视频时间接地的框架,将事件识别与边界测量分开,从而在不…

  6. TOOL · CL_31311 ·

    EvoGround 使用自演化代理进行视频时间定位

    研究人员开发了 EvoGround,一个利用两个自演化代理在没有人工标注数据的情况下执行视频时间定位的新颖框架。该系统包括一个生成器代理,从原始视频中生成查询-时刻对,以及一个定位这些对的求解器代理,并提供反馈以增强生成器。这种自增强循环使代理能够相互改进,在 VTG 基准测试上取得最先进的结果,甚至可以作为细粒度视频字幕生成器。

  7. RESEARCH · CL_06531 ·

    OmniVTG数据集和CoT范式增强了开放世界视频时序定位

    研究人员推出了OmniVTG,这是一个大规模数据集和训练范式,旨在改进多模态大语言模型(MLLMs)的开放世界视频时序定位(VTG)。该数据集采用新颖的流程来识别和收集包含代表性不足概念的视频,并采用以字幕为中心的策略进行高质量标注。此外,还提出了一种自校正思维链(CoT)训练方法,该方法利用MLLMs的理解能力来优化预测,在现有基准和新的OmniVTG数据集上均取得了最先进的性能。