ViT-B/16
PulseAugur coverage of ViT-B/16 — every cluster mentioning ViT-B/16 across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新基准揭示AI知识融合何时有益或有害
一项新的基准研究探讨了在AI模型中结合手工知识与学习表征的有效性,特别是在训练数据稀缺的情况下。研究发现,不同类型的知识来源可以相互补充,从而带来显著的性能提升,例如ViT-B/16在ImageNet上的性能提高了26个百分点。然而,当知识来源过于相似时,它们倾向于相互替代,而过强的先验知识会干扰学习到的表征,导致性能下降。该研究还确定了追溯诊断这些结果并高精度预测未来收益的方法。
-
SPARCL方法解决了解析持续学习中的谱干扰问题
研究人员推出了一种新颖的解析持续学习方法SPARCL,该方法解决了现有方法中存在的谱干扰问题。与容易因共享谱分量而遗忘旧类别的先前方法不同,SPARCL对自相关矩阵进行划分。这使得它能够在高能核心子空间中冻结旧类别的分类器分量,而仅更新残差块。在CIFAR-100和ImageNet-R等数据集上的实验表明,SPARCL显著提高了性能,缩小了经典解析学习器与最先进的表示匹配器之间的差距。
-
AI 管道助力识别古代埃兰楔形文字符号
研究人员开发了 EpigraphNet,一个用于从退化碑文图像中识别埃兰楔形文字符号的新型管道。该系统利用零样本 SAM2 分割来创建干净的符号掩码,然后由经过微调的 Vision Transformer (ViT-B/16) 进行分类处理。EpigraphNet 的性能显著优于现有的 CNN 和 Transformer 基线模型,在 132 类基准测试中取得了 86.41% 的 top-1 准确率,并展示了对常见和罕见符号更均衡的识别能力。
-
新方法改进工业异常检测的校准和评估
研究人员开发了用于校准工业异常检测系统的新方法,特别是在面对分布偏移和标记异常稀缺的情况下。一种方法 SPARC 使用少量已验证的正常图像来调整斑块特征,从而提高 Image AUROC 和 AU-PRO 等性能指标。另一种方法侧重于无分布误报校准和机会校正空间评估,通过考虑异常图与缺陷掩模的空间重叠并考虑机会因素,对检测器性能进行更精确的评估。
-
DCA-MoE框架通过自适应融合和路由增强人群计数
研究人员推出了一种新颖的DCA-MoE框架,旨在通过使特征融合和专家路由依赖于内容来提高人群计数精度。该方法利用空间自适应层融合(SALF)动态加权来自不同骨干层的特征,并利用密度路由多感受野专家(DR-MoE)为每个位置选择最合适的专家。该框架保留了冻结的DINOv3编码器,在NWPU-Crowd基准测试上取得了有竞争力的结果,展示了自适应方法在复杂视觉分析任务中的潜力。
-
新数据集和模型推动手语手势识别发展
研究人员开发了一个用于手语精细孤立手势识别的新数据集和基线模型,并利用了HamNoSys记谱系统。该数据集包含来自15名参与者的144,000张RGB图像,涵盖160个手势类别。使用ResNet-18和ViT-B/16等模型进行的评估在受试者相关测试中展示了可复现的性能,但在泛化到未见过受试者时性能显著下降,凸显了创建无障碍手语技术的挑战。
-
新框架审计AI面部分析中的隐藏公平性风险
研究人员开发了一个名为CIFA(上下文-交叉公平性审计)的新框架,用于识别面部分析系统中隐藏的漏洞。该框架超越了传统的群体公平性指标,还考虑了诸如光照和图像质量等上下文因素,以及这些因素如何与群体属性相互作用。使用ResNet-50和ViT-B/16模型在FairFace和CelebA等数据集上进行的评估显示,被总体准确性和仅基于群体因素的评估所掩盖的性能差异显著。研究还发现,现有的缓解策略并不能持续消除这些隐藏的子群体风险。
-
新框架揭示面部分析AI中隐藏的公平性缺陷
研究人员开发了一个名为CIFA(上下文-交叉公平性审计)的新框架,用于识别计算机视觉模型(尤其是在面部分析领域)中隐藏的漏洞。该框架超越了传统的公平性评估,不仅审计人口统计学属性,还审计光照和图像质量等上下文因素,以及它们与人口统计学属性的交叉。在跨多个数据集的面部性别分类模型(ResNet-50和ViT-B/16)上进行测试时,CIFA揭示了特定子群体中显著的性能差异,这些差异被聚合指标和仅人口统计学分析所忽略。研究还发现,现有的缓…
-
新的AI归因方法以最小的准确率损失提高了稳健性
研究人员开发了一个新框架,以提高AI模型归因方法的忠实度和一致性,尤其是在几何变换下。这种无需标注的方法使用子模搜索来识别驱动模型预测的证据,并引入子模排序损失来对齐跨变换输入的这些选择。在ImageNet数据集上的实验表明,对于ViT、ResNet-50和ConvNeXt-B等架构,在模型准确率影响极小的情况下,归因稳定性和稳健性得到了显著改善。
-
新的 SpecTraL 方法改进了视觉 Transformer 的联邦 LoRA
研究人员开发了一种名为 SpecTraL 的新方法,用于使用低秩适配器 (LoRA) 改进视觉 Transformer (ViTs) 的联邦学习。该方法解决了现有策略的局限性,例如 LoRA 因子的一致性平均和连接本地适配器带来的下载成本增加。SpecTraL 在低秩潜在空间中利用 Householder 变换和随机矩阵理论的原理,将全局共识信号与噪声分离,从而无需手动调整即可发现最优的层级全局秩。实验表明,SpecTraL 增强了准…
-
已识别出AI基准泄露,影响分布外检测准确性
研究人员发现,用于评估AI模型分布外(OOD)检测的基准数据集存在一个重大问题。他们发现,一些基准包含模型训练集中的数据,导致性能指标不准确。这种“泄露”使得模型在检测任务上表现良好,而实际上它们只是识别熟悉的数据。研究人员提出了一种新的诊断工具——“泄露指纹”,以识别此类污染,并提倡建立一个修正后的OOD基准构建协议。
-
新的UpCount方法通过空间感知增强对象计数
研究人员开发了一种新的无类别对象计数方法UpCount,旨在改进复杂对象的空间建模。UpCount利用ViT-B/16编码器提取多层特征,然后使用Dense Prediction Transformers和FeatUp将其精炼成多尺度金字塔。此过程增强了特征的结构和空间敏感性,使一个提议-验证计数头能够识别模式并生成密度图以进行最终计数。该方法在FSC-147数据集上取得了优异的结果,并在CARPK数据集上的车辆计数任务中展示了有效的迁移学习。
-
AI 流程利用不确定性对脑肿瘤 MRI 进行分诊
研究人员开发了一种新颖的脑肿瘤 MRI 分诊流程,该流程利用蒙特卡洛 Dropout 和熵阈值来评估模型置信度。该方法旨在识别可能被错误分类的病例,从而将其推迟给人类放射科医生。该系统在四类脑肿瘤分类中表现出强大的区分能力,宏观 AUC 为 0.994,准确率达到 0.962-0.964。通过校准模型输出并将最不确定的病例推迟,该流程将剩余病例的准确率显著提高到约 0.98。
-
新的SLORR框架以最小的开销增强了神经网络的可压缩性
研究人员推出了一种新颖的SLORR框架,旨在提高神经网络的可压缩性而不牺牲准确性。该方法提供了一种简单、无状态且保留架构的训练中低秩正则化方法。SLORR通过使用GPU友好的近似方法进行正则化传递来实现这一点,在ImageNet-1K等任务上展示了不到8%的训练开销,在大语言模型预训练中开销甚至不到1%。
-
新的ELO算法增强了学习型优化器在长时域任务上的性能
研究人员开发了一种新的元训练算法,称为高效长时域(ELO)学习,以解决当前学习型优化器(LOs)的局限性。ELO通过将计算重新分配到更长的失败模式,并提供解耦的渐进式专家监督来稳定学习信号,从而有效地将元训练扩展到长时域的内部问题。这种方法提高了LOs在语言建模和图像分类等下游任务上的性能和分布外泛化能力,ELO训练的优化器持续优于AdamW,并与Muon竞争。
-
新的ELO算法增强了学优化器在长视野任务上的性能
研究人员开发了一种名为ELO(Efficient Long-hOrizon)的新元训练算法,以改进学优化器(LOs)。ELO解决了元训练扩展到长视野问题以及与Adam和Muon等成熟优化器竞争的挑战。该算法将计算重新分配到更长的失败模式,并使用渐进式专家监督来获得稳定的学习信号。实证研究表明,ELO在下游语言建模和图像分类任务上显著增强了LO的性能,其中ELO-Celo2在语言建模上持续优于AdamW,并与Muon保持竞争力,同时元训…
-
新的自监督学习方法增强了对称数据的表示
研究人员推出了一种名为 Mirror-Fusion-Augmented Self-Supervised Learning (MFASSL) 的框架,旨在改进表示学习,尤其适用于具有双边对称性的数据。与强制执行严格翻转不变性的标准方法不同,MFASSL 通过创建镜像配对视图并使用 Mirror-Fusion Attention 模块来引入软反射先验。这种方法允许镜像区域之间进行自适应交互,同时保留非对称信息。在 CheXpert 和 C…
-
新的 REDI 方法将 Vision Transformer 的 Token 数量减少 46.8%,同时提高了准确性
研究人员开发了一种名为 REDI(Relevance for DINOv3 Token Reduction)的新方法,通过减少 Patch Token 的数量来提高 Vision Transformer 的效率。REDI 将 DINOv3 Patch 表示量化为视觉词汇表,并使用源自 TF-IDF 的类条件语料库分数来对重要 Patch 进行排序和选择。当应用于 DINOv3 ViT-B/16 主干时,这种方法实现了 46.8% 的序…
-
Transformer 与 CNN:结直肠组织学分类基准测试
一项新近发表在 arXiv 上的研究比较了卷积神经网络 (CNN)、基于 Transformer 的模型以及混合架构在结直肠组织学图像分类中的性能。该研究使用 Kather 数据集评估了十二种不同的模型,发现所有模型都达到了高准确率,其中基于 Transformer 的架构通常表现出最强的结果。虽然像 EVA-02 和 ViT-B/16 这样的基于 Transformer 的模型表现最佳,但像 ResNet34 和 ConvNeXt-…
-
新研究揭示图像分类器依赖相位进行身份识别
一篇新研究论文探讨了相位在图像分类器神经网络表征中的作用,并将其与Oppenheim-Lim测试进行了类比,该测试证明了仅凭傅里叶相位即可重建自然图像。研究发现,PRISM2D、GFNet和ViT-B/16等模型在身份识别方面严重依赖相位信息,而幅度信息在读取时作用较小。虽然ResNet-50最初似乎有所不同,但进一步分析显示,根据架构的整流和读取几何形状,在不同基数下会暴露一个潜在的符号编码。