DINOv3
PulseAugur coverage of DINOv3 — every cluster mentioning DINOv3 across labs, papers, and developer communities, ranked by signal.
- used by alphaXiv 90%
- used by Mask2Former 90%
- used by ViT-L/16 90%
- used by ConvNeXt 90%
- used by ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge 90%
- used by YOLOv12 80%
- used by Gotit.pub 70%
- used by DagsHub 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- used by Sam3 70%
- competes with Sam3 70%
17 天有情绪数据
-
A2DINOv3 通过专家协作增强多模态目标检测
研究人员开发了 A2DINOv3,一种新颖的多模态目标检测框架,可提高在低光照等挑战性条件下的性能。该系统采用“社会化协作”方法,将 RGB 和红外分支视为独立的专家,并选择性地交换信息。该方法旨在保留预训练表示并避免模态之间的干扰,利用零初始化策略进行逐步集成。A2DINOv3 在航空检测、自动驾驶和监控等多个基准测试中均取得了最先进的成果。
-
DINO 框架通过视觉特征实现自动驾驶的模拟到现实生成
研究人员推出了一种名为“Driving with DINO”(DwD)的自动驾驶视频生成新框架,该框架利用视觉基础模块(VFM)的特征来弥合模拟与真实世界数据之间的差距。DwD 通过采用主子空间投影来保留关键结构细节,同时丢弃可能引入合成伪影的高频元素,从而解决了一致性-真实性困境。该框架还包含随机通道尾部丢弃,以减轻降维带来的结构损失,并采用空间对齐模块来适应扩散骨干网络的高分辨率特征。此外,因果时间聚合器使用因果卷积来保持历史运动…
-
人工智能模型可自动分析结直肠手术工作流
研究人员开发了AI-ColoWorkflow,一个旨在自动分析微创结直肠手术(MIS-CRS)中手术工作流的深度学习模型。该模型利用DINOv3视觉Transformer和时间卷积网络,从手术视频中识别手术阶段和步骤。AI-ColoWorkflow在四个中心和一个公共数据集上进行了训练,在阶段识别方面表现强劲,并表明通用模型在某些手术分析方面可以与专用模型一样有效,甚至更好。
-
招商局AI实验室推出柔性物体操控技术
招商局集团先进技术研究院旗下的山海关人工智能实验室,公布了其在具身智能和柔性物体操控方面的全栈自研能力。在2026世界机器人大会上,该实验室展示了服装自主折叠的解决方案,表明其有能力弥合模拟与现实世界机器人执行之间的差距。其专有的LiOS云边协同基础设施被强调为使大型模型能够在物理机器人上执行复杂任务的关键,该系统在ICRA 2026 LeHome挑战赛中获得第一名。
-
PATE-Forensics 使用感知作为工具进行可解释的深度伪造检测
研究人员开发了 PATE-Forensics,一种新颖的深度伪造检测和解释方法,将这两个过程解耦。该方法利用了感知作为工具的范式,其中基于 DINOv3 的工具通过将多粒度证据整合到伪造分数图中来处理检测和定位。然后,通用多模态大语言模型利用原始图像和工具的输出来生成解释,而无需进行特定任务的微调。PATE-Forensics 在 DDL-X Track 3 基准测试中取得了 0.89 的最高分,比下一个竞争对手高出 0.19 分。
-
VesselBridge3D框架适应基础模型以实现低数据3D血管分割
研究人员开发了VesselBridge3D,一个旨在改进医学影像中3D血管分割的新框架,特别是在数据稀疏的情况下。该框架使用轻量级3D适应模块来适应现有的基础模型,如DINOv3、MedSAM和MedGemma。VesselBridge3D展示了显著的性能提升,在仅有五个训练样本的情况下,比最先进的方法提高了30%,并在应对域偏移方面表现出卓越的鲁棒性。
-
新方法提升AI生成图像检测的泛化能力
研究人员正在开发新的方法来检测AI生成的图像,以应对跨不同生成技术和数据集的泛化挑战。一种名为“先验条件高斯判别器”(Prior-Conditioned Gaussian Discriminants)的方法,通过分析特征统计数据来构建决策规则,即使在训练数据与测试数据不同时也能表现良好。另一种名为“锚点正则化自适应”(Anchor-Regularized Adaptation, ARA)的方法,使用一种称为低秩自适应(Low-Rank…
-
CrevasseSeg 框架采用标签高效方法进行无人机冰川测绘
研究人员开发了 CrevasseSeg 框架,该框架专为使用无人机 (UAV) 影像进行冰川冰裂缝的高效分割而设计。该方法旨在减少对通常成本高昂且需要专家知识的广泛像素级标注的需求。该研究对各种自监督学习目标和架构进行了基准测试,发现与非线性分类器结合的卫星影像预训练特征,即使在标记数据有限的情况下也能显著提高性能。
-
DCA-MoE框架通过自适应融合和路由增强人群计数
研究人员推出了一种新颖的DCA-MoE框架,旨在通过使特征融合和专家路由依赖于内容来提高人群计数精度。该方法利用空间自适应层融合(SALF)动态加权来自不同骨干层的特征,并利用密度路由多感受野专家(DR-MoE)为每个位置选择最合适的专家。该框架保留了冻结的DINOv3编码器,在NWPU-Crowd基准测试上取得了有竞争力的结果,展示了自适应方法在复杂视觉分析任务中的潜力。
-
新基准和方法推动视频生成模型评估
研究人员推出了 VGI-BENCH,这是一个旨在评估视频生成模型视觉智能的新基准。该基准包含 27 个任务和 810 个实例,旨在评估超越仅生成逼真最终帧的推理能力。初步评估显示,即使是 Seedance 2.0 等先进模型也只能达到 51.0% 的准确率,这表明在内部错误纠正和对输入条件的敏感性等方面仍有很大的改进空间。同时,提出了一种名为 V-RAE 的新方法,该方法利用冻结的视觉表示来创建用于视频生成的语义组织潜在空间,从而实现…
-
LoRCA框架实现组织学到HiP-CT图像的翻译
研究人员开发了LoRCA(LoRA Cycle Adaptation),一个用于将组织学图像翻译成分层相衬断层扫描(HiP-CT)体的新框架。该方法利用固定的DINOv3骨干网络和特定模态的LoRA适配器来学习表示,而无需配对的训练数据。LoRCA旨在改善2D组织学切片与3D HiP-CT体之间的对齐,在翻译质量和结构一致性方面优于现有的CycleGAN方法。
-
DINOv3 微调用于医学图像分类,取得最先进成果
研究人员开发了一种高效的微调方法,用于对最初在自然图像上训练的 DINOv3-H+ 视觉 Transformer 进行非典型有丝分裂图像 (AMF) 分类。通过使用低秩适配 (LoRA) 并仅训练 130 万个参数,结合广泛的数据增强和领域加权 Focal Loss,该模型能有效处理领域异质性。该方法在 MIDOG 2025 挑战赛中取得了最先进的成果,展示了从自然图像到组织病理学数据的强大迁移学习能力。
-
TriView-YOLO模型提升了在复杂土壤条件下空洞的检测能力
研究人员开发了TriView-YOLO,这是一种新颖的深度学习模型,旨在检测具有挑战性的软土高含水量土壤中的地下空洞。该模型采用多视图融合方法,整合了探地雷达数据的三个不同视角,以提高检测精度。TriView-YOLO主要在泰国曼谷的路面调查中进行了测试,平均精度均值(mAP50)达到0.558,证明了其在传统方法难以应对的条件下的有效性。
-
新的SRE-FER框架提高了面部表情识别的准确性
研究人员开发了SRE-FER,一个旨在通过解决局部证据稀释问题来改进细粒度面部表情识别的新框架。当DINOv3等基础模型中的全局聚合可能掩盖细微的肌肉线索时,就会出现此问题,导致相似情绪之间混淆。SRE-FER采用区域残差证据学习方法,结合残差Logits来完善类别边界,而不会改变骨干模型。该框架还利用基于面部动作编码系统(Facial Action Coding System)的动作单元指导,专注于与表情相关的特征,从而提高了在RA…
-
新的DINO-3DRA框架改进了3D脑动脉瘤分割
研究人员开发了DINO-3DRA,一种用于分割3D旋转血管造影(3DRA)数据中脑动脉瘤的新型框架。该系统有效地将来自2D基础模型(如DINOv3)的语义知识转移到3D U-Net架构中。这种双路径方法解决了类别不平衡和形态相似性等挑战,实现了最先进的分割性能,并且可训练参数比现有方法少得多。
-
现代骨干网络提升AI在乳腺摄影分类和病灶定位方面的能力
研究人员探索在多任务DETR框架中使用现代神经网络骨干网络,以增强乳腺摄影分类和病灶定位。研究发现,像ConvNeXtV2和DINOv3这样的先进骨干网络,其性能显著优于旧的残差神经网络架构。ConvNeXtV2在OPTIMAM数据集上表现出特别强的性能,而DINOv3在SGM1k队列上取得了最佳结果,这表明骨干网络质量在多任务乳腺摄影应用中的关键作用。
-
新AI框架实现机器人腹腔镜自主控制
研究人员开发了SurgLAT,一个用于自主控制机器人腹腔镜的新型框架。该系统实时模拟外科医不断变化的注意力状态,使用DINOv3编码器和因果潜在记忆模块来预测手术区域。SurgLAT将注意力跟踪与机器人部署框架相结合,该框架强制执行运动远程中心约束,以实现稳定平滑的内窥镜调整,即使在遮挡或快速移动的情况下也是如此。
-
TriView-YOLO模型采用多视图融合技术检测困难土壤中的空腔
研究人员开发了TriView-YOLO,这是一种新颖的深度学习模型,旨在检测具有挑战性土壤条件下的地下空腔。该模型采用多视图方法,融合了三个不同的雷达扫描视角,以提高在传统方法难以应对的软土高含水层中的检测精度。TriView-YOLO主要在泰国曼谷的数据集上进行训练,在专门的测试集上取得了0.558的平均精度均值(mAP50),证明了其融合输入策略的有效性。
-
多模态AI从无人机视频中对赤鹿进行性别和年龄分类
研究人员开发了一种多模态方法,利用航空RGB-热成像视频对赤鹿的性别和生命阶段进行分类。通过在每个阶段融合来自两个传感器的信息,该流程比单独使用任何一种模态都能提高准确性。这个自动化系统可以将无人机调查从简单的计数转变为可重复的人口统计评估,为野生动物管理提供关键数据。
-
新的ECAD框架将对象检测扩展到离散实例之外
研究人员推出了一种名为ECAD(Expanded Class-Agnostic Detection)的新框架,旨在超越传统的对象检测,识别类别不可知的视觉候选区域,这些区域不局限于离散的、可计数的实例。该方法旨在包含天空、道路和水等通常被当前方法忽略的元素。为了支持ECAD,创建了一个名为BTCO-Bench的新基准,其中包含针对各种场景的类别不可知边界框标注。提出的检测器ECADet利用冻结的DINOv3编码器,并结合了新颖的技术,…