研究人员为 Vision Transformer (ViTs) 开发了一种新的 Token 缩减策略,可在分布偏移下提高性能。这种“后期集中式”策略在后续层中移除更多 Token,与标准的“平坦式”策略相比,始终能提高分布外准确率。该方法以计算量的一小部分恢复了大部分原始准确率,在 ImageNet-C 和其他偏移数据集上,跨不同骨干网络和模态均显示出显著的提升,且无需进行每输入调优。 AI
影响 这项研究有望带来更鲁棒、更高效的 Vision Transformer 模型,尤其是在数据分布偏移常见的实际应用中。
排序理由 详细介绍一种提高模型性能的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →