Vision Transformer Base
PulseAugur coverage of Vision Transformer Base — every cluster mentioning Vision Transformer Base across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
GeoAI框架自动化地理信息系统数据库的建筑足迹验证
研究人员开发了一个GeoAI框架,用于自动验证和净化从高分辨率影像中提取的建筑足迹数据。该框架利用空间特征工程和机器学习分类器(如决策树)来识别和纠正矢量化足迹中的错误。该系统在识别错误足迹并保留可接受足迹方面取得了高精度,显著提高了地理信息系统数据库的纯度。
-
基础模型预训练策略影响视网膜成像迁移能力
一篇新的arXiv论文探讨了基础模型不同的预训练策略如何影响其在超广角视网膜成像任务上的迁移效果。研究人员比较了使用监督学习、掩码自编码器(MAE)和自蒸馏目标训练的Vision Transformer编码器。结果表明,监督学习和自蒸馏方法的表现优于MAE,其中大规模DINOv3模型在诊断糖尿病视网膜病变方面表现最佳。研究还发现,预训练策略会影响模型如何聚合来自不同图像块的证据,并且部分微调可以提高MAE的性能。
-
去噪注意力(DnA)提升视觉任务性能
研究人员推出了一种名为去噪注意力(DnA)的新方法,旨在提高基于注意力模型的视觉任务性能。DnA通过使用正负查询分别识别相关和不相关的图像特征,解决了标准softmax激活产生的噪声注意力模式问题。该方法将交互投影到不同的子空间,增强了特征的可辨别性。当应用于Vision Transformer Base (ViT-B)骨干网络时,DnA在ImageNet-1K上实现了0.8%的绝对增益,并在视频理解任务(包括视频Transforme…
-
CucumberVision 框架使用人工智能进行非接触式长度估算
研究人员开发了一个名为 CucumberVision 的新颖框架,用于非接触式估算温室黄瓜的长度,这对于商业生产至关重要。该系统利用 Intel RealSense D435 RGB-D 摄像头,并采用 YOLO26n 模型进行分割,然后通过 SAM (ViT-B backbone) 进行优化以获得精确的掩码。一种新的内弧样条方法 (M5) 表现出更高的准确性,通过计算拟合到三维中轴的三次样条的弧长,优于其他评估技术。
-
SAM模型在CT扫描中显示出稳定的脾脏分割能力,不受域偏移影响
研究人员评估了分割一切模型(SAM)在腹部CT扫描中进行脾脏分割的鲁棒性,模拟了噪声和分辨率变化等各种域偏移。研究发现,在这些模拟条件下,SAM在分割精度方面保持了稳定的性能,下降幅度极小。这些发现表明,SAM作为医学影像应用的可靠基础模型具有潜力,包括在健康数字孪生领域,因为在这些领域一致的解剖建模至关重要。