ResNet18
PulseAugur coverage of ResNet18 — every cluster mentioning ResNet18 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
受果蝇连接组启发的FlyVision模型展现出强大的视觉性能
研究人员开发了ConnectomeX,一种受果蝇视觉连接组启发的、可训练的架构,旨在改进通用计算机视觉。该模型名为FlyVision,保留了并行ON/OFF处理和循环计算等生物处理元素。FlyVision在MNIST、CIFAR-10和ImageNet-1K等各种基准测试中表现出具有竞争力,且参数量通常远少于ResNet18等成熟模型。此外,FlyVision已被应用于生物医学成像任务,在皮肤病分类和从脑部MRI扫描预测年龄方面显示出潜力。
-
论文探讨用于泰罗尼笔记识别的层次感知深度学习
一篇新论文探讨了使用分层深度学习模型来识别泰罗尼笔记,这是一种古老的拉丁速记系统。研究人员在手写和手稿样本上比较了 ResNet18 和 Vision Transformers 等标准分类器与层次感知模型。结果表明,在适应性有限的情况下,分层模型表现更好,而平面分类器在少样本适应方面表现出色。
-
QSTAR框架通过选择性路由不确定的预测来增强量子迁移学习
研究人员开发了QSTAR,一个新颖的量子迁移学习框架,该框架将不确定的预测选择性地路由到量子分支。这种方法旨在阐明量子组件在机器学习任务中的效用。在Fashion-MNIST上使用ResNet18骨干进行的实验表明,QSTAR,特别是带有自适应KetGPT-QTL头的QSTAR,取得了具有竞争力的准确性,在低置信度样本上优于自适应经典基线。
-
AI框架通过面部表情分析增强帕金森病筛查
研究人员开发了FICAug,一个旨在利用面部表情改进帕金森病筛查的新型框架。该方法通过采用特征信息聚类和数据增强来解决临床数据集小的问题。FICAug对人脸表情特征向量进行聚类,丢弃不一致的簇,并从有效簇内的从高斯采样向量生成合成面部图像。使用FICAug训练的ResNet18模型在UT-MoDaPark数据集上的准确率显著高于标准基线,证明了在数据稀疏场景下引导合成数据生成以学习表征的有效性。
-
新的ProtoCAM框架改进了少样本乳腺病变分类
研究人员开发了ProtoCAM,一个新颖的可解释少样本学习框架,专门用于超声影像中的乳腺病变分类。该方法集成了掩码引导特征编码和原型度量学习,以在有限的训练数据下提高分类准确性。在BUSI数据集上的评估显示,ProtoCAM在3路5样本设置下达到了0.910的宏观F1分数,使用ResNet18作为骨干网络在15样本配置下达到了91.65%的准确率,并提供了可解释的诊断决策见解。
-
新AI框架利用MRI和临床数据改进阿尔茨海默病诊断
研究人员开发了使用多模态数据诊断阿尔茨海默病的新深度学习框架。一项研究侧重于使用解剖学参考来约束基于图像的模型并解决临床数据中的标签泄露问题,通过融合认知评分可达到87.3%的准确率。另一个框架利用3D MRI和临床数据,表明模型性能和解释高度依赖于特定任务、数据模态、融合策略和患者队列。两项研究都强调了用于医学诊断的多模态学习的复杂性以及对可解释性进行仔细评估的必要性。
-
新基准AAMBERS-UAV强调在无人机杂草分割中进行图像采集感知的评估
研究人员开发了一个名为AAMBERS-UAV的新基准,用于评估无人机图像中杂草分割的多模态骨干网络性能。该研究强调了图像采集感知评估的重要性,该评估考虑来自同一调查的空间和时间相关的帧,而不是在图像级别分割数据集。结果表明,当完全排除图像采集时,RGB输入表现最佳;而当在模型开发过程中暴露目标图像采集时,RGB和多光谱(MS)输入的组合产生了更优的结果。研究结果还表明,图像采集暴露对模态排名的影响取决于架构。
-
新的FLaG池化方法提升了跨领域的AI模型性能
研究人员推出了一种新颖的模块——频域潜在注意力门控池化(FLaG),旨在通过在傅里叶域中操作来改进令牌聚合。该方法在池化前将编码器输出重新表达在频域中,从而能够更全面地表示数据。FLaG已在多种任务中展现出有效性,包括蛋白质活性预测、CIFAR-10和CIFAR-100上的图像分类以及多项语言任务,在多项基准测试中表现优于标准的池化方法。
-
深度学习系统准确识别孟加拉国芒果品种
研究人员开发了一个深度学习驱动的网络系统,用于识别孟加拉国芒果品种,解决了区分相似栽培品种的挑战。该系统利用了三个微调的CNN架构,其中EfficientNetB0在测试集上达到了97.36%的最高准确率。该模型拥有约400万个参数,已集成到一个Streamlit网络应用程序中,为孟加拉国的当地农民和农业应用提供了一个实用的工具。
-
深度学习方法提高了卵巢超声分类的准确性
研究人员开发了一种病灶引导的感兴趣区域(ROI)深度学习方法,用于卵巢超声分类,在减少标注工作量的同时实现了高准确性。该方法在MMOTU和OUD两个数据集上进行了评估,使用了各种深度学习架构和传统机器学习分类器。病灶引导的ROI策略,特别是与MaxViT-Tiny模型结合使用时,表现出卓越的性能,在MMOTU上准确率为93.10%,在OUD上准确率为97.56%。
-
新框架为计算机视觉模型提供因果可解释性
研究人员开发了一种新的计算机视觉模型因果可解释性框架,称为空间注意力噪声掩码。该方法在分类前动态掩码输入图像,为模型预测提供因果解释,并将责任分配给特定的输入特征。该框架使用U-Net风格的掩码生成器和ResNet18编码器,确保掩码稀疏且空间平滑,同时保持分类性能。
-
NPU 卸载以时间与性能为代价降低机器人训练能耗
研究人员开发了一种通过将部分计算卸载到神经网络处理单元 (NPU) 来降低机器人策略训练能耗的方法。该方法涉及冻结视觉编码器,并在 NPU 上运行其前向传播,同时在 GPU 上训练动作生成模块。虽然此方法将能耗降低了高达 27.9%,并减少了 GPU 内存分配,但与仅使用 GPU 的基线相比,训练时间增加了高达 37.7%,策略成功率略有下降。
-
显著性引导裁剪在恶意软件图像分类中效果不一
研究人员调查了显著性引导裁剪技术在基于图像的恶意软件分类中的有效性。他们使用RawMal-TF数据集和ResNet18架构进行了实验,比较了四种训练条件:无裁剪、随机裁剪、低显著性裁剪和高显著性裁剪。结果表明,虽然低显著性裁剪略微提高了在自然图像CIFAR-100数据集上的性能,但在RawMal-TF的恶意软件图像上,所有裁剪方法与无裁剪相比,性能均略有下降。这表明显著性引导裁剪的效用是领域特定的,恶意软件图像可能需要不同于自然图像的…
-
经典 SU(2) 模型在视觉任务上优于量子电路
一篇新的研究论文在各种视觉基准测试上比较了经典 SU(2) 模型与变分量子电路 (VQC)。研究发现,四元数神经网络(一种经典 SU(2) 模型)在 MNIST、Fashion-MNIST 和 CIFAR-10 等数据集上的表现与浅层 VQC 相当或更好。虽然四元数网络保持了很高的实值网络性能百分比,但 VQC 显示出较低的准确率和较高的计算成本,这表明对于缺乏内在量子结构的任务,经典 SU(2) 几何可以作为浅层量子电路的有效替代方案。
-
新CPDA框架增强无监督时间序列域自适应
研究人员引入了类条件路径分布对齐(CPDA),一种用于无监督时间序列域自适应的新型框架。与现有对齐边缘特征分布的方法不同,CPDA侧重于对齐源域和目标域的类条件潜在路径分布。该方法利用复合签名-谱核来整合语义特征、时间结构和频域动态,通过源标签和目标伪标签进行类保留对齐。理论分析支持CPDA作为核差异的有效性,大量实验表明其在13个时间序列域自适应基准测试中优于众多基线。
-
四元数网络在视觉任务上表现优于量子电路
研究人员将四元数神经网络与浅层变分量子电路(VQC)在经典监督学习任务上的性能进行了比较。研究发现,在MNIST、Fashion-MNIST和CIFAR-10等基准测试中,四元数网络的性能普遍能媲美或接近实值神经网络的性能。相比之下,浅层VQC的准确率较低,计算成本较高,这表明共享的局部SU(2)几何结构不足以在这些场景中带来实际的量子优势。
-
新的机器遗忘方法可最大限度地减少对相似数据的附带损害
研究人员开发了一种新的机器遗忘方法,旨在最大限度地减少对语义相似数据的附带损害。这种名为保留感知本地化(retain-aware localization)的方法考虑了模型参数对于被遗忘和保留的数据的重要性。在 CIFAR-10 数据集上使用 ResNet18 模型进行的实验表明,该方法在有效减少附带损害的同时,也提高了标准的遗忘指标。
-
研究发现:量化会影响深度学习模型解释
一篇新发表在arXiv上的研究调查了训练后量化(PTQ)如何影响深度学习模型的可解释性。研究人员使用结合了Grad-CAM和LIME的双重框架,在INT8和INT4精度下评估了五种常见的CNN架构(VGG19、ResNet18、EfficientNet-B0、DenseNet161和MobileNetV2)。研究结果表明,量化会改变模型的内部推理,尽管DenseNet161的分类准确率与EfficientNet-B0相似,但其可解释性…
-
物理感知数据增强改进了激光散斑材料分类
研究人员探讨了数据增强技术如何影响深度学习模型在激光散斑模式分类以进行材料识别方面的性能。他们使用ResNet18和EfficientNet-B0在SensiCut数据集上进行的研究发现,高斯模糊和独立噪声等标准增强方法是有害的,因为它们会破坏散斑模式中至关重要的结构信息。相反,保持散斑组织的空间相关扰动显著提高了模型的鲁棒性。研究结果表明,专注于结构保持的物理感知增强设计是有效相干光学传感应用的关键。
-
研究发现:量化会影响深度学习模型解释
一项新研究调查了训练后量化(PTQ)对深度学习模型可解释性的影响,特别关注了五种卷积神经网络(CNN)架构。研究人员发现,虽然像INT8和INT4这样的量化方法在很大程度上保留了分类准确性,但它们会显著改变模型的内部推理和解释。该研究使用了一个结合了Grad-CAM和LIME的双重框架来分析空间注意力和输入级特征归因,结果表明在低精度下保持可解释性,架构选择至关重要。