PulseAugur
中
实时 23:33:41
English(EN) Pocket-STVG: lightweight architecture for Spatio-Temporal Video Grounding

Pocket-STVG 提供高效的时空视频精确定位

研究人员开发了 Pocket-STVG (P-STVG),一种专为时空视频精确定位 (STVG) 设计的新型轻量级架构。该系统旨在准确地在视频中定位与自然语言查询相对应的时空区域。P-STVG 通过高效地组合预训练组件来实现这一点,包括基于 MobileViCLIP 的时域感知视频编码器和源自 MDETR 的空间编码器-解码器,而不是依赖大型的端到端模型。该架构的参数少于 9000 万个,并提供了有利的性能-效率权衡,其性能与现有的弱监督方法相当,并且在计算成本显著降低的情况下优于早期的零样本方法。 AI

影响 这种轻量级架构可以为 AI 应用提供更高效、更易于访问的视频分析工具。

排序理由 该集群包含一篇详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Pocket-STVG 提供高效的时空视频精确定位

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Alberto Presta, Michal Byra, Grzegorz Stefa\'nski, Karol Szurkowski, Eryk Ko{\l}odziejczyk, Krzysztof Arendt ·

    Pocket-STVG:用于时空视频基础的轻量级架构

    arXiv:2609.31135v1 Announce Type: cross Abstract: Spatio-Temporal Video Grounding (STVG) aims to localize the spatio-temporal tube in a video corresponding to a natural language query. While recent methods achieve strong performance in fully supervised, weakly supervised, and zer…