PulseAugur
实时 08:26:03
English(EN) Rethinking Data Efficiency in Industrial Dense Prediction: Pretraining Coherence, Not Inductive Bias, Determines ViTs Low-Data Advantage

Vision Transformers 的数据效率与其预训练一致性相关,而非固有偏置

一篇新的研究论文挑战了普遍的看法,即 Vision Transformers (ViTs) 在工业密集预测任务中比卷积神经网络 (CNNs) 需要更多的标记数据。该研究表明,感知到的数据效率差距主要是由于 ViT 主干和 CNN 颈部之间的预训练不一致性造成的,而不是 ViTs 的基本架构限制。研究人员提出了一种新颖的 AlignBlock 来重新校准特征,并证明通过适当的对齐,ViTs 在领域邻近数据集上可以优于 CNNs,而在领域遥远的情况下,CNNs 仍然具有优势。 AI

影响 挑战了关于 ViT 数据需求的传统观念,表明改进的预训练策略可以为这些模型在工业应用中释放更大的效率。

排序理由 在 arXiv 上发表的研究论文,详细介绍了模型预训练和数据效率方面的发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Vision Transformers 的数据效率与其预训练一致性相关,而非固有偏置

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Haoran Sui, Yaoyuan Jia ·

    重新思考工业密集预测中的数据效率:预训练一致性而非归纳偏置决定了ViT的低数据优势

    arXiv:2608.10590v1 Announce Type: new Abstract: Vision Transformers (ViTs) are widely believed to require more labeled data than CNNs for industrial dense prediction. Through controlled experiments on four industrial datasets, we show that the data-efficiency gap stems from pretr…