研究人员发现视觉 Transformer (ViTs) 表现出一种涌现式的“物体绑定”能力,使它们能够辨别不同的图像块是否属于同一个物体。然而,这种能力在空间上是有限的,随着图像块之间距离的增加,绑定信号会显著减弱。这种有限的空间范围及其相关的基线在各种物体大小、ADE20K 和 COCO 等数据集以及 DINO 和 CLIP 等不同的模型骨干网络中都保持一致,这表明它是所学表征的一种内在属性。 AI
影响 揭示了当前视觉 Transformer 架构中物体绑定的基本局限性和属性。
排序理由 详细介绍视觉 Transformer 涌现属性的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →