PulseAugur
实时 21:44:35
English(EN) TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2 通过新颖的区间集优化推进视频时序定位 · 已追踪 2 个来源

研究人员推出 TimeLens2,这是一种用于通用视频时序定位的多模态大语言模型。与以往侧重描述视频内容的模型不同,TimeLens2 能精确定位视频中的证据时间点。该模型采用新颖的方法将时序证据视为一个区间集,从而改进了对可变长度视频和多样化查询类型的任务的监督和优化。为支持这种训练方法,创建了一个包含已验证定位实例的 TimeLens2-93K 数据集。该模型在七个基准测试中的表现显示出显著的改进,其较大版本取得了最先进的成果,并超越了许多更大的开源模型。 AI

影响 通过实现证据的精确时序定位,推动了视频理解的发展,可能提高了 AI 在视频内容中追踪信息的能力。

排序理由 该集群描述了一篇关于视频时序定位新颖模型和方法论的最新研究论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

TimeLens2 通过新颖的区间集优化推进视频时序定位 · 已追踪 2 个来源

报道来源 [2]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    TimeLens2:使用多模态大语言模型进行通用视频时序定位

    Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video le…

  2. arXiv cs.CV TIER_1 English(EN) · Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang ·

    TimeLens2:使用多模态大语言模型进行通用视频时序定位

    arXiv:2607.17423v1 Announce Type: new Abstract: Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardi…