实体
VidSTG
VidSTG
PulseAugur coverage of VidSTG — every cluster mentioning VidSTG across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的并行管解码方法可大幅缩短视频定位延迟
研究人员开发了一种名为并行管解码(PTD)的新方法,以提高时空视频定位的效率和准确性。该技术消除了自回归依赖,通过允许同时进行空间和时间定位,显著降低了延迟。PTD将定位过程分解为时间块和时间条件空间块,这些块被并行解码。该方法还引入了解耦块注意力,以在消除跨框依赖的同时保持上下文。实验表明,PTD在延迟方面取得了显著降低,吞吐量有所提高,并且还展示了对相关视频理解任务的泛化能力。
-
CaptionFormer模型统一视频对象跟踪和字幕生成
研究人员开发了CaptionFormer,这是一种新颖的端到端模型,旨在统一视频中的对象检测、分割、跟踪和字幕生成任务。为了解决密集视频对象字幕生成中带注释数据有限的挑战,该团队使用视觉语言模型生成了合成字幕,并用这些新注释扩展了现有数据集。CaptionFormer在三个既定基准VidSTG、VLN和BenSMOT上展示了最先进的性能。