Vision Transformers
PulseAugur coverage of Vision Transformers — every cluster mentioning Vision Transformers across labs, papers, and developer communities, ranked by signal.
- used by Imagenet 1k 90%
- developed Data Efficient Image Transformers 90%
- instance of ViT-Small/16 90%
- instance of Imagenet 1k 70%
- used by Data Efficient Image Transformers 70%
- used by CLS token 70%
- used by Dino 70%
- used by DeiT-S 70%
- instance of DeiT-S 70%
- competes with Data Efficient Image Transformers 60%
- used by ViT-Small/16 60%
- affiliated with Dino 50%
- 2026-06-10 research_milestone A new paper introduces register tokens to improve Vision Transformer performance and interpretability in face recognition. 来源
- 2026-05-22 research_milestone A new paper proposes a method to improve Vision Transformer performance on dense prediction tasks by addressing semantic diffusion. 来源
- 2026-05-22 research_milestone A new paper proposes a method to improve Vision Transformer performance on dense prediction tasks. 来源
- 2026-05-22 research_milestone A new paper introduces stabilized Vision Transformers and a training recipe that achieves state-of-the-art results on the Apple Dense Material Segmentation benchmark. 来源
14 天有情绪数据
-
新方法可视化 Vision Transformer 中的特征演化
研究人员开发了一种新方法,通过检查网络深度和训练时间上的特征演化来可视化 Vision Transformer (ViT) 的训练过程。利用稀疏自编码器 (SAE),他们能够识别和追踪特征在训练过程中出现和层间迁移的情况。分析显示,特征迁移(即特征最易被检测到的层发生变化)主要发生在训练早期,并且倾向于向更早的层移动,深层比浅层更早稳定。
-
研究Vision Transformer注意力转移,鲁棒性差距与训练成熟度相关
一篇新发表在arXiv上的研究论文探讨了Vision Transformer(ViTs)中注意力机制的转移。研究人员发现,虽然经过训练以模仿教师模型的注意力图的ViTs在分布内准确率方面表现很高,但在分布偏移下表现不佳。研究表明,注意力转移几乎是完美的且永久的,但观察到的鲁棒性差距在很大程度上是训练成熟度的产物,当训练计划完成后会消失。研究结果表明,在这种情况下,注意力图揭示的是模型“看”哪里,而不是模型“知道”什么。
-
新的眼动数据集旨在提高癌症影像AI的可解释性
研究人员推出GazeXPErT,一个旨在增强肿瘤FDG-PET/CT扫描中AI模型可解释性和赋能性的新数据集。该数据集捕获专家眼动追踪数据,将注视模式与肿瘤检测和测量决策相关联。目标是通过理解人类专家如何视觉处理医学图像,来促进开发更值得信赖和更具交互性的AI诊断工具。初步实验表明,眼动数据可以显著提高AI模型性能并预测专家意图。
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
FairNVT 框架提高了 Vision Transformers 的公平性
研究人员推出了一种名为 FairNVT 的新颖框架,旨在提高 Vision Transformers 在分类任务中的公平性。这种轻量级方法旨在减少敏感属性信息在模型表示中的泄露,从而在不显著影响任务性能的情况下提高预测公平性。FairNVT 通过学习与任务相关的敏感嵌入,对敏感嵌入应用校准噪声,并结合正交约束和公平性正则化将其整合到任务表示中来实现。
-
SpIn-ViT 框架增强了视觉 Transformer 的可解释性和准确性
研究人员开发了 SpIn-ViT,这是一个将视觉 Transformer (ViT) 与稀疏自编码器 (SAE) 集成的创新框架,以增强可解释性和性能。与之前事后应用 SAE 的方法不同,SpIn-ViT 对 ViT 和 SAE 进行端到端联合训练,直接将稀疏表示与分类目标对齐。这种方法产生的语义连贯的神经元激活可以定位有意义的图像区域,同时保持具有竞争力的准确性。评估表明,SpIn-ViT 在分类准确性、基于 AI 的可解释性分数和…
-
TabSOM方法通过提高可解释性来增强表格数据的深度学习能力
研究人员开发了TabSOM,一种将表格数据编码为图像表示的新方法,以增强深度学习模型的应用。与仅考虑单个特征值的先前方法不同,TabSOM利用自组织映射(SOMs)来捕捉特征值及其相互关系。该方法在各种二元分类数据集上,与十二种现有的表格到图像技术相比,表现出了优越的性能和可解释性。
-
新的深度学习模型使用高光谱成像评估鱼类新鲜度 · 2篇论文
研究人员开发了两种新颖的深度学习方法,使用高光谱成像来评估鱼类新鲜度。第一种,SGNet,是一种轻量级架构,旨在高效提取光谱和空间特征,以显著少于现有模型的参数实现了高分类精度。第二种方法引入了一个少样本学习框架,可以用有限的标记数据进行逐日新鲜度估算,优于传统回归方法。这两种方法都显示出在工业环境中进行实时、无损质量评估的潜力。
-
ALiBi位置编码减少了视觉Transformer中的偏差
研究人员已经识别并解决了视觉Transformer(ViTs)中的位置偏差问题,特别是在DINOv2等模型中。这些偏差源于位置编码等架构选择,可能会阻碍在没有固有方向线索的图像任务上的零样本适应。研究表明,通过微调ViTs使用ALiBi相对位置编码,可以显著减少这些偏差,同时保留通用的语义理解。由此产生的无偏差特征在复杂显微镜图像的可训练分割中取得了成功。
-
Vision Transformers 的数据效率与其预训练一致性相关,而非固有偏置
一篇新的研究论文挑战了普遍的看法,即 Vision Transformers (ViTs) 在工业密集预测任务中比卷积神经网络 (CNNs) 需要更多的标记数据。该研究表明,感知到的数据效率差距主要是由于 ViT 主干和 CNN 颈部之间的预训练不一致性造成的,而不是 ViTs 的基本架构限制。研究人员提出了一种新颖的 AlignBlock 来重新校准特征,并证明通过适当的对齐,ViTs 在领域邻近数据集上可以优于 CNNs,而在领域…
-
新方法检测 Vision Transformers 中的虚假相关性
研究人员开发了一种新方法来检测 Vision Transformers 中的虚假相关性,这些虚假相关性是模型可能利用的、非预期的模式。这个基于 token 的诊断流程应用了留一 token 移除技术,以量化模型对非核心视觉线索的依赖程度。在 ImageNet 数据集上的实验证明了该流程识别这些虚假相关性的能力,表明训练方法显著影响模型的易感性。该研究还强调了此类线索的常见来源,如水印和背景伪影,并包含了一个关于浸润性乳腺肿块分类的案例研究。
-
新的iBKD框架在数据稀疏情况下将CNN归纳偏置迁移到Vision Transformers
研究人员开发了一个新的知识蒸馏框架iBKD,旨在提高Vision Transformers (ViTs) 在训练数据有限时的性能。该方法通过在整个训练过程中保留空间网格结构,有效地将卷积神经网络 (CNNs) 的归纳偏置迁移到ViTs。iBKD中的核心归纳偏置注意力模块可以锐化结构线索并将其注入ViT,从而在部署时得到一个未修改的ViT,没有额外的推理开销。iBKD在多个基准测试中,尤其是在数据稀疏的情况下,表现优于现有方法。
-
新方法加速 Vision Transformer 在边缘设备的适配
研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。
-
新的HSMLA方法提高了视觉Transformer在密集预测任务中的效率
研究人员推出了一种名为HSMLA(分层Softmax多尺度线性注意力)的新方法,旨在提高视觉Transformer在处理高分辨率密集预测任务时的效率。该方法结合了用于全局上下文的线性注意力和用于局部特征和多尺度Token表示的选择性softmax细化。HSMLA在多种任务中展示了显著的加速效果,包括CT器官分割和病理WSI分析,推理时间速度提升高达4.2倍。
-
HyperFake 使用高光谱重建进行高级深度伪造检测
研究人员开发了一种新颖的深度伪造检测方法 HyperFake,该方法通过从标准 RGB 视频中重建高光谱数据来揭示隐藏的操纵痕迹。该方法利用改进的 MST++ 架构进行高光谱重建,并使用光谱注意力机制来识别关键光谱特征。然后,通过基于 EfficientNet 的模型对处理后的光谱数据进行分类,从而在无需专用高光谱相机的情况下,实现对各种深度伪造风格更准确、更具泛化性的检测。
-
新的UniDFKD框架增强了Vision Transformers的无数据知识蒸馏能力
研究人员推出了一种新颖的无数据知识蒸馏框架UniDFKD,该框架解决了Vision Transformers等现代神经网络架构中的局限性。与依赖于特定架构统计先验的先前方法不同,UniDFKD利用了与架构无关的语义先验。该方法通过分类语义条件、空间语义锚定和空间语义蒸馏来指导数据合成和知识迁移,从而带来显著的性能提升。
-
新论文审计 Grad-CAM 在 Vision Transformers 上的应用
一篇新论文系统地分析了 Grad-CAM(一种用于可视化 AI 模型决策的技术)在 Vision Transformers (ViTs) 上的应用。虽然 Grad-CAM 最初是为卷积神经网络 (CNNs) 设计的,但 ViTs 具有基于 token 和注意力机制的不同架构。研究发现,许多论文在将 Grad-CAM 应用于 ViTs 时,没有充分详细说明方法论选择,这可能导致严谨性和可复现性方面出现问题。
-
新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源
研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。
-
Gemini API 图像标记成本详解
Google 的 Gemini API 通过将图像分解为视觉块来对其进行标记化,成本取决于图像分辨率。高达 384x384 像素的图像被视为一个标记,成本为 258 个标记。较大的图像被分成 768x768 像素的图块网格,每个图块的成本为 258 个标记。这种标记化过程对于开发人员管理 API 成本和优化多模态应用程序中的上下文窗口使用至关重要。
-
MOAT防御流水线保护Vision Transformer免受效率下降攻击
研究人员推出了一种新颖的防御流水线MOAT,旨在保护Vision Transformer(ViT)免受会降低其效率的对抗性攻击。MOAT采用一系列输入变换,使其具有模型无关性,并与用于降低计算成本的现有令牌修剪技术兼容。实验表明,MOAT有效地将攻击下的GFLOPs下降限制在原始模型性能的3.4%以内。