ResNet50
PulseAugur coverage of ResNet50 — every cluster mentioning ResNet50 across labs, papers, and developer communities, ranked by signal.
- 2026-06-17 research_milestone A new two-stage fine-tuning method for ResNet50 was published on arXiv for improved melanoma detection. 来源
4 天有情绪数据
-
新研究强调图像编码器的“表征风险”
一篇新研究论文提出了预训练图像编码器中的“表征风险”概念,证明了不同的编码器可能导致下游预测任务的结果显著不同。该研究评估了包括SigLIP 2、ResNet50和DINOv2在内的十种编码器,应用于预测房价、赛马表现和医学诊断等各种场景。研究结果表明,没有一种编码器是普遍最优的,而一个涉及在锁定数据上进行基准测试和验证的建议工作流程可以提高预测性能和不确定性报告,该工作流程已在LOOKAGAIN-ML软件包中实现。
-
新 AI 框架 CirrGuide 改进了肝硬化分割和分类
研究人员开发了 CirrGuide,一个新颖的深度学习框架,用于从 T2 加权 MRI 扫描中分割肝硬化并对其严重程度进行分类。该框架采用级联方法,首先使用带有 ResNet50 编码器的 Attention U-Net 架构预测肝硬化的软掩码。然后,该掩码作为第二个基于 ResNet50 的分类分支的解剖学先验,该分支结合全局和区域特征来区分轻度、中度和重度肝硬化。CirrGuide 在 CirrMRI600+ 数据集上表现强劲,分…
-
鸟类识别模型:边缘设备上的分辨率与架构权衡
一项新研究调查了鸟类物种识别模型的最佳输入分辨率,特别是对于像NVIDIA Jetson Orin Nano这样的边缘设备。研究人员发现,模型架构对准确性的影响比输入分辨率更大,像DINOv2-L这样的模型在更大的分辨率下能实现更高的准确性。研究还强调了在部署引擎上测量准确性的重要性,因为半精度计算会降低某些架构(如ViT-S/16)的性能,而CNN则基本不受影响。该研究探索了14种输入分辨率和六种架构,测量了延迟和准确性的权衡,为诸…
-
大地艺术作为人工智能驱动的气候指示器
研究人员开发了一种新颖的方法,通过分析卫星图像将罗伯特·史密森1970年的大地艺术作品《螺旋码头》用作气候传感器。通过检查1984年至2025年的1,744个图像碎片,他们提取了包括熵和纹理特征在内的复杂性特征,并将其与气候数据进行了比较。研究发现,置换熵和平均强度与湖泊水位密切相关,而来自ResNet50嵌入的人工智能衍生特征则作为水文状态的领先指标,可提前约三年预测湖泊水位。
-
CNNs在不同图像类型的黑色素瘤检测中进行比较
一篇新的研究论文评估了几种预训练卷积神经网络(CNNs)在黑色素瘤检测中的有效性,使用了皮肤镜图像和组织病理学图像。该研究利用了HAM10000、ISIC-2018和CR-AI4SkIN等数据集,比较了包括ResNet50、VGG16、VGG19、MobileNet和InceptionV3在内的架构。结果表明,ResNet50在皮肤镜图像上表现最佳,在HAM10000数据集上准确率为84%,在CR-AI4SkIN数据集的组织病理学图像…
-
新方法在人工智能检测中使用缺陷掩码进行空间监督
研究人员开发了一种新颖的工业检测缺陷定位方法,通过在模型训练期间将真实缺陷掩码重新用作空间监督信号。该方法提高了分类网络精确定位缺陷区域的能力,即使在混合使用带掩码和不带掩码(包括扩散生成的)图像进行训练时也是如此。在 MVTec-AD 瓶子基准上的评估表明,对于 EfficientNetB0 和 ResNet50 等模型,定位精度有了显著提高,特别是与扩散模型增强结合使用时,这表明现有的评估数据可以作为实用的训练信号来改善模型注意力。
-
新框架利用基于注意力的融合增强多模态情感识别
研究人员开发了一种新的多模态情感识别框架,集成了音频和视觉数据。音频部分使用Wav2Vec2、MFCC和声学描述符,并通过BiLSTM进行处理,而视频部分则采用ResNet50-BiLSTM架构。多头注意力机制用于融合这些特征,使模型能够自适应地权衡每个模态的贡献。在MELD和IEMOCAP数据集上的实验表明,与现有方法相比,在数据不平衡的情况下,性能有了显著提升。
-
医学基础模型增强脑部MRI造影剂剂量模拟
研究人员开发了一种新的脑部MRI造影剂剂量模拟方法,该方法利用医学基础模型的特征作为感知损失。与使用标准自然图像骨干网络相比,这种方法旨在提高图像合成的准确性。研究发现,RadImageNet模型在作为特征提取器使用时,在减少残余增强和在脑部MRI模拟中保持忠实的剂量降低轨迹方面表现出优越的性能。
-
深度学习系统准确识别孟加拉国芒果品种
研究人员开发了一个深度学习驱动的网络系统,用于识别孟加拉国芒果品种,解决了区分相似栽培品种的挑战。该系统利用了三个微调的CNN架构,其中EfficientNetB0在测试集上达到了97.36%的最高准确率。该模型拥有约400万个参数,已集成到一个Streamlit网络应用程序中,为孟加拉国的当地农民和农业应用提供了一个实用的工具。
-
轻量级机器学习框架提供可解释的疟疾诊断
研究人员开发了一种名为EMFE的新机器学习框架,用于疟疾细胞分类。与当前准确但资源密集且不透明的深度学习模型不同,EMFE采用了基于五种特征的经典机器学习算法。这种方法提供了一种计算上轻量级且可解释的替代方案,在大规模数据集上实现了高精度,并通过严格的交叉验证和与深度学习模型的比较证明了其有效性。
-
新框架使用扩散模型为5G系统合成真实的网络物理攻击
研究人员开发了Diff-DDoS,一个旨在提高5G赋能系统网络物理攻击检测能力的新框架。该框架利用表格扩散模型合成真实的攻击数据,解决了标记攻击样本稀缺的问题。通过采用对抗性扩散训练(ADT),Diff-DDoS旨在提高入侵检测器对自适应对手的鲁棒性,在各种攻击场景下与现有方法相比,F1分数有了显著提高。
-
基于概念的可解释人工智能揭示深度神经网络的弱点和数据集偏差
研究人员探索了使用基于概念的可解释人工智能(CXAI)方法来理解多标签图像分类中深度神经网络(DNN)的学习弱点和偏差。通过在 MS-COCO 数据集上训练 VGG16 和 ResNet50 模型,并应用 CRP 和 CRAFT 等 CXAI 技术,研究发现更高的概念区分度可以减少标签和概念中的混淆。分析还强调了数据集中环境概念如何暴露模型固有的偏差。
-
新的CoLoRA方法为CNN提供高效微调
研究人员推出了一种新颖的、参数高效的微调方法CoLoRA,该方法专为卷积神经网络(CNN)设计。该技术通过将卷积核更新分解为轻量级的深度卷积和逐点卷积组件,将LoRA的原理扩展到了卷积层。与完全微调相比,CoLoRA显著减少了可训练参数数量(超过80%),同时保持了原始模型大小和推理复杂度。在OCTMNISTv2等医学成像数据集上,使用VGG16和ResNet50等模型进行的实验表明,CoLoRA在分类性能上具有竞争力。
-
新型 Mamba 网络架构提升掌静脉生物识别性能
研究人员为掌静脉生物识别开发了一种新的拓扑感知全局-局部 Mamba 网络架构。该方法将多尺度局部特征与结构引导的方向流和全局路径相结合,在基准数据集上实现了高精度。与 ResNet50 和 GLVM 等现有模型相比,所提出的方法在准确性和参数数量方面表现出竞争力。
-
新框架整合AI用于工业缺陷检测和报告
一篇新研究论文介绍RobustDefect-LLM,一个整合深度学习与决策支持和AI辅助报告的工业表面缺陷分类框架。该系统使用四个卷积神经网络,其中MobileNetV3-Large在NEU-DET数据集上达到了99.26%的最高准确率。虽然在名义条件下鲁棒,但模型在严重图像退化下的准确率显著下降。该框架包含一个针对低置信度预测的人工审查系统,并生成通过确定性一致性检查的报告。
-
新的拓扑感知骨干网络增强掌静脉生物识别
研究人员开发了一种新颖的拓扑感知全局-局部骨干网络,用于掌静脉识别这一细粒度生物识别任务。该方法将多尺度局部特征与结构引导的方向流以及使用六个拓扑感知块的全局路径相结合。该系统在公共数据集上实现了高精度,在参数数量和EER方面优于ResNet50和ViT-S等现有方法。
-
新的Hear to See方法推进了音频-视觉实例分割
研究人员开发了一种名为Hear to See (H2S)的新方法,以改进音频-视觉实例分割。该技术解决了将重叠的声音事件与视觉实例匹配以及处理音频和视觉信号之间时间错位等挑战。H2S利用声学语义投影仪来解缠混合音频并建立分层对应关系,并利用音频调制的Mamba异步动态调制器进行自适应状态转换,以实现鲁棒跟踪。
-
病理学基础模型在有丝分裂计数检测方面展现潜力
研究人员探索了病理学基础模型(FMs)作为有丝分裂计数检测编码器的有效性,将其应用从通常的分类任务扩展开来。该研究将几种基础模型,包括H-optimus-0和Virchow模型,与ResNet50基线进行了比较,并将它们集成到不同的检测架构中,如RetinaNet、Faster R-CNN和Deformable DETR。结果表明,H-optimus-0和Virchow模型表现出具有竞争力的性能,这表明通过图像级自监督训练的基础模型潜…
-
ResNet50 在 X 光片肺部疾病分类方面优于 VGG 模型
研究人员探索了深度学习模型 VGG16、VGG19 和 ResNet50 对 X 光图像肺部疾病进行分类的有效性。该研究在大型 X 光图像数据集上训练了这些模型,以识别肺炎、肺结核和肺癌等病症。结果表明,虽然所有模型表现良好,但 ResNet50 在疾病分类方面表现出更高的准确性和效率。
-
从头开始训练的CNN模型与预训练模型相比存在显著差距
一项在Food-101数据集上比较两个卷积神经网络(CNN)的实验揭示了使用预训练权重的重要优势。从头开始训练的TinyVGG在30个epoch后仅达到23%的准确率,而利用ImageNet预训练权重并仅训练分类器头的ResNet50在同期内达到了超过65%的准确率。初始训练epoch就显示出显著差异,TinyVGG为2%,ResNet50为52%,凸显了预训练模型中嵌入的先验知识的价值。