DeiT-S
PulseAugur coverage of DeiT-S — every cluster mentioning DeiT-S across labs, papers, and developer communities, ranked by signal.
-
注视动态Transformer模仿人眼视觉,实现高效与鲁棒性
研究人员开发了一种受人眼视觉系统注视采样和眼动启发的注视动态Transformer(FDT)。该架构动态选择要处理的Token,在无需针对这些挑战进行专门训练的情况下,即可提高效率和对噪声及对抗性攻击的鲁棒性。在50%的注视预算下,FDT展现出比DeiT-S更高的准确率,同时显著减少了计算量,展示了准确率与效率之间有希望的权衡。
-
新的深度剪枝方法提高了视觉Transformer的效率
研究人员开发了一种名为HetDPT的新方法来改进视觉Transformer(ViTs)的深度剪枝。该方法考虑了不同层之间的异构性,而这是先前深度剪枝技术的局限性。HetDPT避免了维度不匹配的问题,并在ImageNet-1K和CIFAR-100等数据集上实现了显著的加速,同时保持了准确性。当与宽度剪枝结合时,HetDPT+在极端的ViT剪枝方面设定了新的最先进水平,在接近无损准确率的情况下实现了更高的加速比。
-
Fusion框架统一视觉Transformer适配以提高效率
研究人员开发了Fusion,一个旨在通过统一的顺序令牌适配技术来提高视觉Transformer(ViTs)效率的新型框架。该框架以分阶段的方式协调令牌合并、提前退出和令牌修剪,使这些机制能够协同工作而非竞争。Fusion还集成了轻量级路由模块,无需重新训练即可动态调整准确率-延迟权衡。在DeiT-S的ImageNet-1k上的实验表明,Fusion在计算预算方面匹配或超过了最先进的自适应ViT方法,同时显著降低了校准误差和推理能耗。
-
视觉 Transformer 减少了面部反欺骗系统中的人口统计学偏差
一篇新发表在 arXiv 上的研究调查了视觉 Transformer (ViT) 架构对人脸呈现攻击检测 (PAD) 系统中人口统计学偏差的影响。该研究使用 CASIA-SURF Cross-Ethnicity Face Anti-Spoofing (CeFA) 数据集,将 ViTs 与卷积神经网络 (CNNs) 进行了比较。结果表明,与 CNN 基线相比,ViT 模型,特别是 DeiT-S 架构,在不同族裔群体中实现了更高的准确率,…