一篇新的研究论文挑战了普遍的看法,即 Vision Transformers (ViTs) 在工业密集预测任务中比卷积神经网络 (CNNs) 需要更多的标记数据。该研究表明,感知到的数据效率差距主要是由于 ViT 主干和 CNN 颈部之间的预训练不一致性造成的,而不是 ViTs 的基本架构限制。研究人员提出了一种新颖的 AlignBlock 来重新校准特征,并证明通过适当的对齐,ViTs 在领域邻近数据集上可以优于 CNNs,而在领域遥远的情况下,CNNs 仍然具有优势。 AI
影响 挑战了关于 ViT 数据需求的传统观念,表明改进的预训练策略可以为这些模型在工业应用中释放更大的效率。
排序理由 在 arXiv 上发表的研究论文,详细介绍了模型预训练和数据效率方面的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →