研究人员推出了一种新颖的细粒度视觉识别方法——子词视觉Transformer(SubViT),它改进了标准的视觉Transformer。SubViT选择性地对图像块进行分词,通过用多个子词表示区分性区域来分配更多容量,同时保留全局上下文。该方法分两个阶段进行训练,以识别和提炼信息性注意力图,从而无需额外的正向传播即可直接预测词的重要性。SubViT在广义类别发现等挑战性任务上显著提高了准确性,在CUB、FGVC-Aircraft和Stanford Cars等数据集上提升了DINOv2的性能,同时延迟和计算成本仅略有增加。 AI
影响 这种新的分词方法有望在各种应用中实现更高效、更准确的细粒度图像识别模型。
排序理由 该集群包含一篇详细介绍计算机视觉新模型架构的研究论文。
- arXiv
- CIFAR-10
- DINOv2
- FGVC-Aircraft
- ImageNet-100
- Stanford Cars
- Subtoken Vision Transformer
- Vision Transformers
- Retina Patch
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →