研究人员开发了ProgResViT,这是一种新颖的自适应视觉Transformer,它通过多个回合渐进式地处理图像。该方法从低分辨率图像和较窄的子网络开始,当置信度高时终止推理,或继续处理更高分辨率和更宽的子网络以进行精炼。该系统利用渐进式条件软门控(PSG)根据当前回合、块和输入分辨率来条件化token融合和层输出。ProgResViT在图像分类任务上展示了比现有自适应方法更好的准确性-计算权衡,并在自监督学习和语义分割方面显示出潜力。 AI
影响 这种自适应方法可能导致AI模型中更高效的图像处理,降低分类和分割等任务的计算成本。
排序理由 该集群包含一篇详细介绍视觉Transformer新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →