研究人员推出了一种新颖的端到端开放词汇动态场景图生成框架 OvDSGG。该系统通过识别固定训练词汇之外的对象和谓词,解决了现有闭集方法的局限性。OvDSGG 利用开放词汇空间骨干网络和时间骨干网络,并由三元组特征提取模块和视觉-语言对齐模块增强,无需昂贵的知识蒸馏即可实现自适应决策边界。一个新的基准(改编自 Action Genome,具有不相交的基础/新颖分割)证明了 OvDSGG 在现有开放词汇基线上的优越性能。 AI
影响 这项研究推进了视频理解中的开放词汇能力,有可能改进视频字幕和问答等下游任务。
排序理由 该集群包含一篇详细介绍动态场景图生成新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Action Genome
- arXiv
- Hugging Face
- OvDSGG
- Spatial Backbone
- Temporal Backbone
- Triplet Feature Extraction Module
- Visual-Language Alignment Module
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →