研究人员开发了 bViT,一种新颖的视觉 Transformer 架构,它使用单个 Transformer 块重复应用于图像识别。这种循环方法在 ImageNet-1K 上实现了与标准 ViT 相当的准确度,但参数却少得多。研究表明,ViT 的大部分深度可以通过循环计算来实现,尤其是在表示空间较宽的情况下,从而能够对下游任务进行参数高效的微调。 AI
影响 引入了一种参数高效的视觉 Transformer 架构,有望降低图像识别任务的计算成本。
排序理由 该集群包含一篇详细介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →