研究人员开发了 Pocket-STVG (P-STVG),一种专为时空视频精确定位 (STVG) 设计的新型轻量级架构。该系统旨在准确地在视频中定位与自然语言查询相对应的时空区域。P-STVG 通过高效地组合预训练组件来实现这一点,包括基于 MobileViCLIP 的时域感知视频编码器和源自 MDETR 的空间编码器-解码器,而不是依赖大型的端到端模型。该架构的参数少于 9000 万个,并提供了有利的性能-效率权衡,其性能与现有的弱监督方法相当,并且在计算成本显著降低的情况下优于早期的零样本方法。 AI
影响 这种轻量级架构可以为 AI 应用提供更高效、更易于访问的视频分析工具。
排序理由 该集群包含一篇详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →