实体
Spatio-Temporal Video Grounding
Spatio-Temporal Video Grounding
PulseAugur coverage of Spatio-Temporal Video Grounding — every cluster mentioning Spatio-Temporal Video Grounding across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
ScanFocus框架通过粗粒度到细粒度方法增强视频定位
研究人员推出ScanFocus,一个旨在改进时空视频定位(STVG)的新框架。该方法解决了在视频中平衡全局上下文与精确对象定位的挑战,而当前方法由于计算成本和时间下采样常常难以应对。ScanFocus采用粗粒度到细粒度策略,首先进行全局扫描生成初始提案,然后通过语义引导时间聚合器(SGTA)进行细化,以捕捉细粒度细节和快速运动变化,从而实现精确的时间戳回归。在多个基准测试上的实验表明,ScanFocus的性能优于现有方法。
-
新研究解决了长视频中的时空视频基础问题
两篇新研究论文探讨了时空视频基础的进展,这是一种根据自然语言查询精确地在长视频中定位对象的技术。第一篇论文介绍了一个将帧级跟踪转变为秒级跟踪的流水线,并使用强化学习来改进推理和定位。第二篇论文提出了一种自回归Transformer架构,该架构通过顺序处理、整合记忆库和采用级联时空定位方法来应对长视频的挑战。
-
新微调方法为视频接地保留知识
研究人员开发了一种名为Null-Space Tuning (NST)的新方法,以改进时空视频接地模型。该技术解决了在不破坏现有知识的情况下,将预训练模型适应低质量视频输入的问题。NST通过向输入特征注入可学习的残差来实现这一点,这些残差对模型的冻结骨干网络选择性地不可见,从而在纠正退化输入的同时保留预训练知识。