研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。 AI
影响 这些方法可以显著降低将大型 Vision Transformer 模型适配到特定应用所需的计算成本和时间,从而能够在资源受限的设备上更广泛地部署。
排序理由 两篇 arXiv 论文提出了用于 Vision Transformer 高效适配的新颖方法。
- arXiv
- CBIS-DDSM
- Circuit Fine-Tuning
- Cub 200 2011 Caltech Birds Dataset
- Gemma 3
- Parameter-Efficient Fine-Tuning
- Swin Transformer
- Vision Transformers
- VTAB-1k
- genetic programming
- Hugging Face
- ImageNet-1K
- LayerNorm
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →