PulseAugur
实时 07:21:19
English(EN) A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

新的DSGG方法利用MLLMs,改进评估指标

研究人员提出了一种利用多模态大语言模型(MLLMs)的动态场景图生成(DSGG)新方法。该研究指出了当前评估协议的局限性,例如精度-召回率权衡和信息量不足的关系生成,并引入了五个新指标以进行更全面的评估。提出的模型设计将自下而上的流程转变为自上而下的推理后定位策略,将逐帧动态图重构为时间关系集预测,并结合了重要性感知微调(IAF),以实现更相关和更多样化的关系生成。在Action Genome、VidVRD和PVSG数据集上的实验证明了其达到了最先进的性能。 AI

影响 这项研究通过改进AI模型随时间理解对象关系的方式,可能带来更准确和实用的视频理解系统。

排序理由 该集群包含一篇详细介绍动态场景图生成新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的DSGG方法利用MLLMs,改进评估指标

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim ·

    在多模态大语言模型时代,深入探究动态场景图生成

    arXiv:2503.15846v2 Announce Type: replace Abstract: Dynamic Scene Graph Generation (DSGG) aims to capture objects and their evolving relations in videos. Despite recent progress, the practicality and quality of generated scene graphs remain limited compared to the rapid advances …