研究人员推出了一种新颖的层次化视觉Transformer——Iwin Transformer,旨在克服现有视觉Transformer(ViTs)的局限性。这种新架构在一个块内结合了交错窗口注意力和深度卷积,有效降低了注意力机制的二次复杂度。Iwin Transformer 还实现了增强的可扩展性,能够支持在不同分辨率下的微调以及从2D到3D应用的权重迁移。初步结果显示,在ImageNet-1K上的准确率有所提高,在Kinetics-400等视频分析任务上表现具有竞争力,同时在分割和图像生成方面也显示出有效性。 AI
影响 提供了一种更高效、更具可扩展性的视觉Transformer方法,有望提高图像和视频分析任务的性能。
排序理由 介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- ADE20K
- FlashDiT
- ImageNet-1K
- Iwin Transformer
- Kinetics-400
- Simin Huo
- Swin Transformer
- Vision Transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →