研究人员调查了自监督Vision Transformer (ViTs),例如DINOv2中特定Token类型的功用。通过在寄存器Token和高范数异常Patch Token上训练稀疏自编码器,他们发现寄存器Token与高级语义概念的联系更紧密,而异常Token则与背景和纹理模式相关。因果消融实验证明了显著的功能不对称性,破坏寄存器衍生的特征会导致表示相似度大幅下降,而破坏异常衍生的特征则不会。 AI
影响 揭示了Vision Transformer Token的专业化,可能指导未来架构改进以获得更好的语义理解。
排序理由 该条目是一篇阐述Vision Transformer研究成果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DINOv2
- high-norm outlier patch tokens
- register tokens
- Sparse Autoencoders
- Uniform Manifold Approximation and Projection
- Vision Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →