研究人员提出了一种利用多模态大语言模型(MLLMs)的动态场景图生成(DSGG)新方法。该研究指出了当前评估协议的局限性,例如精度-召回率权衡和信息量不足的关系生成,并引入了五个新指标以进行更全面的评估。提出的模型设计将自下而上的流程转变为自上而下的推理后定位策略,将逐帧动态图重构为时间关系集预测,并结合了重要性感知微调(IAF),以实现更相关和更多样化的关系生成。在Action Genome、VidVRD和PVSG数据集上的实验证明了其达到了最先进的性能。 AI
影响 这项研究通过改进AI模型随时间理解对象关系的方式,可能带来更准确和实用的视频理解系统。
排序理由 该集群包含一篇详细介绍动态场景图生成新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Action Genome
- Dynamic Scene Graph Generation
- Importance-Aware Finetuning
- Multimodal Large Language Models
- PVSG
- Temporal Relation Set
- VidVRD
- Xuanming Cui
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →