YouTube-VIS
PulseAugur coverage of YouTube-VIS — every cluster mentioning YouTube-VIS across labs, papers, and developer communities, ranked by signal.
-
SemanticSlots 通过 Transformer 解码器推进视频对象中心学习
研究人员推出了 SemanticSlots,一种用于视频对象中心学习的新颖方法,解决了传统解码器架构的局限性。通过采用基于 Transformer 的解码器,SemanticSlots 使槽能够充当独立于对象位置的语义查询,从而能够在没有复杂时间预测器的情况下分解后续视频帧。该方法在 YouTube-VIS 数据集上显著提高了性能,在 mBO 上比以前的最先进方法提高了 21 个点,并达到了 86.6% 的 ARI。
-
QueenVIS框架在无视频训练的情况下增强了视频实例分割
研究人员推出了一种名为QueenVIS的新颖框架,旨在通过关注单帧训练期间对象查询的质量来改进视频实例分割(VIS)。该方法挑战了传统上对视频级监督和昂贵身份一致性标注的依赖。QueenVIS通过用于特征和中心预测的辅助头来增强对象查询,这些辅助头在推理过程中被丢弃,不会增加计算开销。该框架利用一种无需训练的查询传播方法和一个内存库来维护时间身份,在YouTube-VIS和OVIS等基准测试中取得了显著的性能提升。
-
新的DSSA方法通过分离外观和身份来改进视频对象学习
研究人员推出了一种新颖的自监督框架Dual-State Slot Attention (DSSA),旨在改进无监督视频对象中心学习。DSSA通过在帧之间解耦对象的外观与其身份,解决了现有方法的局限性,防止了由于快速运动或遮挡导致的对象槽交换问题。该框架利用一个用于每帧外观的局部状态和一个通过学习到的循环转换更新的独立身份状态,充当时间过滤器。在MOVi-C和YouTube-VIS等数据集上的实验表明,DSSA提高了分割质量和时间一致性…
-
Grounded Correspondence框架简化视频对象学习
研究人员引入了一个名为Grounded Correspondence的新框架,用于视频对象中心学习。该方法用确定性的二分匹配取代了传统学习的动力学模块,利用现有的自监督视觉骨干网络来保持时间一致性。该方法在时间建模方面不需要任何可学习的参数,并在多个基准测试中取得了有竞争力的结果。