Video Object-Centric Learning
PulseAugur coverage of Video Object-Centric Learning — every cluster mentioning Video Object-Centric Learning across labs, papers, and developer communities, ranked by signal.
-
SemanticSlots 通过 Transformer 解码器推进视频对象中心学习
研究人员推出了 SemanticSlots,一种用于视频对象中心学习的新颖方法,解决了传统解码器架构的局限性。通过采用基于 Transformer 的解码器,SemanticSlots 使槽能够充当独立于对象位置的语义查询,从而能够在没有复杂时间预测器的情况下分解后续视频帧。该方法在 YouTube-VIS 数据集上显著提高了性能,在 mBO 上比以前的最先进方法提高了 21 个点,并达到了 86.6% 的 ARI。
-
新的SSync方法增强了视频对象中心学习
研究人员推出了一种新颖的视频对象中心学习(VOCL)方法——选择性协同学习(SSync)。SSync解决了现有基于槽(slot-based)框架的局限性,这些框架依赖于编码器-解码器架构和对比学习。与先前无差别地对齐空间图(spatial maps)的方法不同,SSync通过使用编码器进行边界细化和解码器进行内部去噪来选择性地提取可靠线索。这种选择性方法通过线性复杂度的伪标签(pseudo-labeling)实现,避免了二次空间比较,…
-
选择性协同学习 (SSync) 增强视频对象中心学习
研究人员推出了一种名为选择性协同学习 (SSync) 的新方法,以增强视频对象中心学习。SSync 通过伪标签和传递性合并选择性地提取可靠线索,解决了现有方法的局限性,从而提高了对象分解的质量和鲁棒性。该方法避免了在无差别对齐策略中出现的错误传播,并提供了比以前的二次方方法更具可扩展性的线性复杂度解决方案。
-
新方法改进视频物体学习中的时间一致性
研究人员开发了新的方法来改进视频以物体为中心的学习中的时间一致性。一种方法,“内化时间一致性”,引入了时序通道分解和跨时序重构,以在没有显式损失的情况下隐式地强制执行一致性。另一种方法,“隐式周期一致性”,将周期一致性约束从槽空间转移到重构流形,以避免特征塌陷并提高在复杂基准测试上的性能。这两种方法都旨在增强视频中的物体发现和识别。