PulseAugur
实时 12:02:29
English(EN) OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

新框架实现开放词汇动态场景图生成

研究人员推出了一种新颖的端到端开放词汇动态场景图生成框架 OvDSGG。该系统通过识别固定训练词汇之外的对象和谓词,解决了现有闭集方法的局限性。OvDSGG 利用开放词汇空间骨干网络和时间骨干网络,并由三元组特征提取模块和视觉-语言对齐模块增强,无需昂贵的知识蒸馏即可实现自适应决策边界。一个新的基准(改编自 Action Genome,具有不相交的基础/新颖分割)证明了 OvDSGG 在现有开放词汇基线上的优越性能。 AI

影响 这项研究推进了视频理解中的开放词汇能力,有可能改进视频字幕和问答等下游任务。

排序理由 该集群包含一篇详细介绍动态场景图生成新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架实现开放词汇动态场景图生成

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · John Helsby, Yi Yang, Bodo Rosenhahn, Michael Ying Yang ·

    OvDSGG:端到端开放词汇动态场景图生成

    arXiv:2608.14835v1 Announce Type: new Abstract: Dynamic scene graphs (DSGs) capture spatio-temporal interactions across videos as $\langle$subject, predicate, object$\rangle$ triplets, and underpin downstream tasks such as video captioning, video question answering, and action an…