PulseAugur
中
实时 11:37:49
实体 Vision Transformer Base

Vision Transformer Base

PulseAugur coverage of Vision Transformer Base — every cluster mentioning Vision Transformer Base across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_273486 ·

    DCM-SAM 系统改进了金属增材制造中的缺陷分割

    研究人员开发了 DCM-SAM,这是一种用于通过 X 射线计算机断层扫描分割金属增材制造零件中缺陷的新型系统。该系统采用缺陷条件自适应 LoRA 专家混合模型,利用固定的 Segment Anything 主干,并为每个缺陷类别配备单独的 LoRA 专家。DCM-SAM 仅使用合成数据进行训练,就能在未直接接触真实扫描的情况下实现高精度。该系统还解决了在 AI 加速器上部署的挑战,针对 Qualcomm Hexagon NPU 进行了…

  2. TOOL · CL_257151 ·

    新基准GeoCrossBench旨在实现遥感模型的跨波段泛化

    研究人员推出了GeoCrossBench,这是GeoBench基准的扩展,用于评估遥感基础模型的跨波段泛化能力。这个新基准包括用于标准分布内性能、对未见波段的泛化以及对具有训练波段超集的测试输入的泛化的协议。为了支持这一点,开发了一个名为$\chi$ViT的自监督模型作为基线。使用11,900个NVIDIA H100 GPU小时进行的实验显示,尽管DOFA和Vision Transformer Base等模型在特定设置下表现良好,但在…

  3. TOOL · CL_231424 ·

    新 ViTAMINS 方法通过合成负样本增强视觉 Transformer 训练

    研究人员开发了 ViTAMINS,一种通过引入合成难负样本来训练自监督视觉 Transformer 的新方法。该方法提高了表示质量,在 ImageNet 等基准测试以及图像检索和分割等各种下游任务上取得了显著改进。该方法展示了涌现的分类能力,性能优于现有基线,甚至超过了像 V-JEPA with ViT-L 这样的大型模型。与对比学习中的生成方法和自蒸馏方法相比,ViTAMINS 提供了一种更具资源效率且功能更强大的替代方案。

  4. TOOL · CL_229554 ·

    新的MCSeg网络通过混合变换器-CNN模型推进心脏图像分割

    研究人员开发了MCSeg,一种用于分割心脏图像的新网络架构。该模型利用体积变换器编码器与CNN解码器相结合,并通过新颖的Scaling Feature Pyramid模块进行连接。该网络使用掩码图像建模进行预训练,然后使用区域互信息损失进行微调,以提高边界精度。在各种心脏数据集上,MCSeg已证明其性能优于十一种最先进的方法,并在少样本学习场景中显示出潜力。

  5. TOOL · CL_216177 ·

    新框架使用 DINOv2 增强跨域目标检测

    研究人员开发了一个名为语义定位增强教师 (SLE-T) 的新框架,以使用视觉基础模型 (VFMs) 改进跨域目标检测。该方法解决了教师模型和学生模型之间的空间尺度差异和语义不兼容问题,以及源域训练的教师模型遗漏目标域对象的问题。SLE-T 框架利用轻量级的 SLE Adapter 和 DINOv2,增强了其识别能力,并确保了特征兼容性,从而实现更有效的知识转移。实验表明,SLE-T 在显著减少训练时间和计算资源的情况下,实现了最先进的性能。

  6. TOOL · CL_204156 ·

    地理人工智能工作流程绘制城市树冠及其与城市温度的联系

    研究人员开发了一种新的光学地理人工智能工作流程,用于评估加州戴维斯市的城市树冠覆盖。该方法利用高分辨率图像和深度学习模型(如 DeepForest 和 Segment Anything Model (SAM))来识别和绘制单个树冠和整体树冠表面的地图。该工作流程成功绘制了该市 9.37% 的树冠地图,与现有的激光雷达辅助产品高度一致,并揭示了树冠覆盖与地表温度之间的负相关关系,强调了城市绿化在缓解高温方面的重要性。

  7. RESEARCH · CL_203811 ·

    新的QUASAR方法在低比特量化中提升LLM准确性

    两篇新研究论文介绍了QUASAR,一种用于提高量化大语言模型准确性的新方法。第一篇论文侧重于一种无需训练的训练后量化方法,该方法解决了残差补偿中的数值稳定性问题,并在Vision Transformer Base模型上取得了优异的成果。第二篇论文将QUASAR作为一种感知量化训练技术,通过将感知重构纳入训练循环来降低损失下限,在Qwen3和Llama-3.1等模型上显著提高了准确性和KL散度。

  8. TOOL · CL_194054 ·

    GeoAI框架自动化地理信息系统数据库的建筑足迹验证

    研究人员开发了一个GeoAI框架,用于自动验证和净化从高分辨率影像中提取的建筑足迹数据。该框架利用空间特征工程和机器学习分类器(如决策树)来识别和纠正矢量化足迹中的错误。该系统在识别错误足迹并保留可接受足迹方面取得了高精度,显著提高了地理信息系统数据库的纯度。

  9. TOOL · CL_180934 ·

    基础模型预训练策略影响视网膜成像迁移能力

    一篇新的arXiv论文探讨了基础模型不同的预训练策略如何影响其在超广角视网膜成像任务上的迁移效果。研究人员比较了使用监督学习、掩码自编码器(MAE)和自蒸馏目标训练的Vision Transformer编码器。结果表明,监督学习和自蒸馏方法的表现优于MAE,其中大规模DINOv3模型在诊断糖尿病视网膜病变方面表现最佳。研究还发现,预训练策略会影响模型如何聚合来自不同图像块的证据,并且部分微调可以提高MAE的性能。

  10. RESEARCH · CL_111633 ·

    去噪注意力(DnA)提升视觉任务性能

    研究人员推出了一种名为去噪注意力(DnA)的新方法,旨在提高基于注意力模型的视觉任务性能。DnA通过使用正负查询分别识别相关和不相关的图像特征,解决了标准softmax激活产生的噪声注意力模式问题。该方法将交互投影到不同的子空间,增强了特征的可辨别性。当应用于Vision Transformer Base (ViT-B)骨干网络时,DnA在ImageNet-1K上实现了0.8%的绝对增益,并在视频理解任务(包括视频Transforme…

  11. TOOL · CL_113494 ·

    CucumberVision 框架使用人工智能进行非接触式长度估算

    研究人员开发了一个名为 CucumberVision 的新颖框架,用于非接触式估算温室黄瓜的长度,这对于商业生产至关重要。该系统利用 Intel RealSense D435 RGB-D 摄像头,并采用 YOLO26n 模型进行分割,然后通过 SAM (ViT-B backbone) 进行优化以获得精确的掩码。一种新的内弧样条方法 (M5) 表现出更高的准确性,通过计算拟合到三维中轴的三次样条的弧长,优于其他评估技术。

  12. RESEARCH · CL_08187 ·

    SAM模型在CT扫描中显示出稳定的脾脏分割能力,不受域偏移影响

    研究人员评估了分割一切模型(SAM)在腹部CT扫描中进行脾脏分割的鲁棒性,模拟了噪声和分辨率变化等各种域偏移。研究发现,在这些模拟条件下,SAM在分割精度方面保持了稳定的性能,下降幅度极小。这些发现表明,SAM作为医学影像应用的可靠基础模型具有潜力,包括在健康数字孪生领域,因为在这些领域一致的解剖建模至关重要。