ConvNeXt V2
PulseAugur coverage of ConvNeXt V2 — every cluster mentioning ConvNeXt V2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新基准CARDIAG标准化冠状动脉造影分析的深度学习
研究人员推出了CARDIAG,这是一个旨在标准化冠状动脉造影分析深度学习模型评估的新基准。该基准包含一个多中心数据集,具有各种注释和指标,用于评估像素级分类准确性。研究评估了24种不同的架构,发现具有DeepLab V3 Plus解码器的ConvNeXt V2编码器表现最佳,宏F1得分为0.456,通过与Mamba U-Net和Feature Pyramid Network集成,该得分进一步提高到0.479。
-
人工智能融合OCT和OCTA图像以改善糖尿病视网膜病变诊断
研究人员开发了一种新颖的跨模态融合技术,结合了光学相干断层扫描(OCT)和OCT血管造影(OCTA)正面图像,以改善糖尿病视网膜病变的诊断。该方法利用双向跨模态注意力网络整合结构OCT数据和血管OCTA信息。在两个数据集上的实验表明,融合方法显著优于仅依赖OCT数据的模型,其中翻译后的OCTA(TR OCTA)显示出与地面真实OCTA相当或更优的结果,并增强了对领域迁移的鲁棒性。
-
新架构融合RGB和热红外数据以改进语义分割
研究人员开发了一种新颖的RGB-热红外语义分割架构,以应对恶劣光照条件下的挑战。所提出的方法采用双ConvNeXt V2骨干网络,并进行阶段式、模态自适应融合。它包含一个用于早期特征的基于频率的融合模块,以及一个带有跨模态注意力的用于后期特征的语义融合模块,通过有效整合可见光和红外图像来增强场景理解。
-
新模型融合RGB和热红外数据以改进语义分割
研究人员开发了一种新颖的融合架构,用于同时使用RGB和热红外图像进行语义分割。该方法采用了分阶段的融合策略,包括一个基于频率的模块,该模块分离红外特征以增强热模式和边界。该系统在MFNet和PST900数据集上进行了测试,以显著更少的参数和更低的计算成本实现了具有竞争力的mIoU分数。
-
研究人员评估VLMs和聚类技术在社交媒体气候变化视频分析中的应用
研究人员开发了ClimateVID,这是一个用于分析气候变化相关社交媒体视频的新数据集和方法论。该研究评估了VideoChatGPT、PandaGPT和VideoLLava等各种视觉语言模型(VLMs)的零样本能力,发现它们目前难以检测气候特定类别。然而,使用ConvNeXt V2和DINOv2等图像嵌入模型的无监督聚类技术成功地识别了视频数据中有意义的视觉模式。