一篇新发表在arXiv上的研究论文探讨了Vision Transformer(ViTs)中注意力机制的转移。研究人员发现,虽然经过训练以模仿教师模型的注意力图的ViTs在分布内准确率方面表现很高,但在分布偏移下表现不佳。研究表明,注意力转移几乎是完美的且永久的,但观察到的鲁棒性差距在很大程度上是训练成熟度的产物,当训练计划完成后会消失。研究结果表明,在这种情况下,注意力图揭示的是模型“看”哪里,而不是模型“知道”什么。 AI
影响 表明Vision Transformer中的注意力图可能无法完全捕捉模型的知识,影响我们评估和改进其鲁棒性的方式。
排序理由 学术论文,详细介绍了关于Vision Transformer注意力机制的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →