Slot Attention
PulseAugur coverage of Slot Attention — every cluster mentioning Slot Attention across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
面向对象的表示提升了机器人模仿学习能力
研究人员开发了一种用于机器人视觉运动模仿学习的面向对象的表示方法。该方法将特征分组到每个对象的槽中,提供了一种结构化的替代方案,取代了传统的全局场景嵌入或密集斑块网格。在 ManiSkill3 PickCube-v1 基准测试上的实验表明,使用冻结的 DINO ViT-B/16 编码器和 Slot Attention 的面向对象的表示,成功率达到了 55.0%,显著优于基于密集 DINO 全局特征的基线。进一步的改进,包括明确的二维空…
-
Slot-RAE 利用直接表示自编码器简化以对象为中心的学习
研究人员推出了一种名为 Slot-RAE 的新框架,旨在简化用于真实世界场景理解的以对象为中心的学习。与依赖复杂流程和 Stable Diffusion 等外部生成模型的先前方法不同,Slot-RAE 直接在 DINOv3 等视觉基础模型的特征空间内运行。这种集成方法使用了一个 Diffusion Transformer 解码器和一个表示对齐头,从头开始训练,没有 VAE 瓶颈或与任务无关的预训练。在 COCO 数据集上的实验表明,S…
-
新的DSSA方法通过分离外观和身份来改进视频对象学习
研究人员推出了一种新颖的自监督框架Dual-State Slot Attention (DSSA),旨在改进无监督视频对象中心学习。DSSA通过在帧之间解耦对象的外观与其身份,解决了现有方法的局限性,防止了由于快速运动或遮挡导致的对象槽交换问题。该框架利用一个用于每帧外观的局部状态和一个通过学习到的循环转换更新的独立身份状态,充当时间过滤器。在MOVi-C和YouTube-VIS等数据集上的实验表明,DSSA提高了分割质量和时间一致性…
-
研究人员为面向对象的学习平滑槽注意力迭代
研究人员开发了SmoothSA,这是一种在面向对象的学习(OCL)框架中增强槽注意力(SA)的新方法。该方法通过使用输入特征信息预热冷启动查询来解决SA处理图像和视频初始帧的局限性。此外,SmoothSA区分了视频中第一帧和后续帧的聚合变换,以改进递归处理。实验表明,SmoothSA在对象发现、识别和视觉推理任务中是有效的。