ViT-Small
PulseAugur coverage of ViT-Small — every cluster mentioning ViT-Small across labs, papers, and developer communities, ranked by signal.
-
DINOv3 特征细化以实现高效眼前段分割
研究人员开发了一种新颖的方法,使用蒸馏的 DINOv3 ViT-Small 主干来分割眼前段 (AES)。该方法包含一个步进注意力特征细化模块,用于为密集预测任务调整多级 Transformer 表示。在八种眼科方案的 333 张图像的私有数据集上进行评估,该方法达到了 85.55% 的 mIoU,并且与包括其他基于 DINOv3 的技术在内的现有基线相比,在未见过的公共数据集上表现出对领域迁移的卓越鲁棒性。
-
轻量级AI模型识别猛禽物种,保障风力涡轮机安全
研究人员开发了一个轻量级图像分类系统,用于在边缘设备上识别猛禽物种,专门用于风力涡轮机碰撞缓解。该系统利用知识蒸馏,以一个大型DINOv2-L模型作为教师,训练MobileNetV4、ViT-Small和EfficientNet-B0等小型模型。通过将数据集扩展到12,500多张图像,特别是增加了白尾海雕的图像数量,该系统显著提高了该物种的召回率并减少了误分类错误。当使用TensorRT部署在NVIDIA Jetson Orin Na…
-
深度学习框架从视频中估算海岸波浪参数
研究人员开发了一种新颖的深度学习框架,用于从单目视频中估算五个关键的海岸波浪参数。该系统利用V-JEPA骨干网络在具有挑战性的视觉条件下提取特征,采用双流SlowFast时间编码器,并基于Farneback算法的光流流。尽管在只有六个带注释的训练场景的数据受限环境下运行,该框架在诸如有效波高和波浪方向等参数上显示出统计学上显著的时间相关性,表明其可行性以及在更大数据集下改进的潜力。
-
AnomExpert框架提高了产前超声异常诊断的准确性
研究人员开发了AnomExpert,一个旨在提高产前超声异常诊断准确性的新框架。该系统利用案例级监督和可学习平面原型,将超声图像组织成解剖平面的表示,而无需显式的平面注释。AnomExpert通过为特定异常选择诊断相关的平面来进一步优化诊断。在大型数据集上的实验中,AnomExpert使用ViT-small骨干网络,在准确率和F1分数上均优于其他九种多实例学习方法,准确率达到86.9%,F1分数达到84.2%。
-
新的自适应检查点技术可大幅减少视觉模型微调的GPU内存占用
研究人员开发了一种自适应检查点算法,以减少微调视觉模型和视觉语言模型(VLMs)所需的GPU内存。该方法在显存有限的消费级GPU上进行了测试,在可控的能耗开销下,显著降低了峰值内存使用量,最高可达79%。研究还比较了各种参数高效微调(PEFT)技术,发现QLoRA和BitFit在准确性略有下降的情况下能节省大量能源,而DINOv2等自监督模型在某些任务上的表现优于微调模型。
-
CLEAR-MoE 将冻结的 Vision Transformers 转换为稀疏 MoE 模型
研究人员开发了 CLEAR-MoE,这是一种新颖的训练后方法,可以将冻结的 Vision Transformers (ViTs) 转换为稀疏专家混合 (MoE) 模型,而无需更改原始骨干网络的权重。该技术涉及一个四阶段的流程,对前馈网络层进行评分和分解,训练轻量级路由器,并分派 token。在各种 ViT 骨干网络上进行的实验表明,CLEAR-MoE 可以保留几乎所有密集模型的准确性,其中共享的奇异值分解 (SVD) 基础对于保持性能…
-
自适应赫布路由增强了少样本视觉 Transformer 的性能
研究人员为少样本视觉 Transformer 开发了一种自适应赫布记忆路由方法,以提高从有限数据中进行图像识别的能力。该方法使用轻量级 MLP 路由器来动态控制赫布记忆的贡献、更新强度和先前记忆的保留。在各种骨干网络和数据集上的实验表明,自适应变体与固定的赫布方法相比,提高了性能并缩短了推理时间,显示了自适应可塑性和记忆激活的好处。
-
新框架统计分析视觉 Transformer 的可靠性
研究人员开发了 SENTRY,一个用于分析视觉 Transformer (ViTs) 在软错误下的可靠性的统计框架。该方法利用有限总体抽样理论提供正式的可靠性保证,显著降低了故障注入活动的成本。对 ViT-Tiny 和 ViT-Small 模型的评估显示,虽然很少的比特翻转会导致故障,但一旦发生,就会导致准确率急剧下降,通常集中在归一化层和特定的浮点数位。
-
赫布快速权重增强了用于少样本字符识别的 Vision Transformer
研究人员通过将赫布快速权重 (HFW) 模块集成到 Vision Transformer 架构中,开发了一种新的少样本字符识别方法。与依赖固定表征的标准 Transformer 不同,该方法旨在模仿生物神经网络在推理过程中形成瞬时联想记忆的能力。当应用于 Swin-Tiny 模型时,该策略在 Omniglot 基准测试的 5 路 1 样本分类中达到了 96.2% 的准确率,在 5 路 5 样本分类中达到了 99.2% 的准确率,略优于…