ConvNeXt
PulseAugur coverage of ConvNeXt — every cluster mentioning ConvNeXt across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
FCBNet 在航空影像中提供参数高效的杂草检测
研究人员开发了 FCBNet,这是一种参数高效的卷积神经网络,用于检测多光谱航空影像中的伪装杂草。该模型采用冻结的 ConvNeXt 主干和新颖的特征校正块 (FCB) 进行高效特征精炼,并结合轻量级解码器。FCBNet 在 WeedBananaCOD 和 WeedMap 数据集上表现出卓越的性能,mIoU 超过 85%,并且优于 U-Net 和 SegFormer 等模型,由于其参数高效的设计,所需的训练时间和内存显著减少。
-
新的MeCSAFNet架构改进了多光谱土地覆盖分割
研究人员推出了一种新颖的多编码器架构MeCSAFNet,专为多光谱图像的语义分割(特别是土地覆盖分类)而设计。该网络利用双ConvNeXt编码器独立处理可见光和非可见光光谱通道,然后融合它们的特征。该融合过程通过注意力机制和专门的激活函数得到增强,以确保稳定的优化。在基准数据集上的实验表明,与U-Net和SegFormer等现有模型相比,MeCSAFNet在平均交并比(mIoU)方面取得了显著的改进,其紧凑型变体为资源受限的应用提供了效率。
-
新型STORK模型可自动检测胎儿MRI中的子宫收缩
研究人员开发了STORK,这是一种新颖的多实例学习模型,旨在检测胎儿MRI扫描中的子宫收缩。该模型采用弱监督方法,基于系列级标签进行训练,无需逐帧标注。STORK分解时空卷积以有效捕捉组织运动和位移,在一个约700个MRI系列的数据集上实现了95.0%的系列级AUROC和94.6%的AUPRC。该模型识别胎盘以外预测性特征的能力,为分析子宫活动提供了一种新的自动化工具。
-
新型适配器改进了从脑信号中检索图像的功能
研究人员开发了一种名为 RPA(残差块-令牌适配器)的新型适配器,旨在改进从脑电图 (EEG) 和脑磁图 (MEG) 脑信号中检索图像的功能。该适配器通过利用 Vision Transformer (ViT) 编码器中间层的全部块令牌来工作,与仅使用单个全局嵌入的方法相比,保留了更丰富的视觉信息。实验表明,保留所有块令牌对于 EEG 对齐至关重要,而 CLS 令牌提供的独特信息最少。RPA 系统在 THINGS-EEG2 和 THIN…
-
线性映射能有效捕捉AI特征空间中的图像编辑
研究人员调查了深度学习模型内部特征空间中的图像操纵表示方式。他们的研究发现,一个简单的、空间共享的线性映射通常能近乎完美地预测各种图像编辑的结果,包括几何、光度和语义变化,其效果与更复杂的模型相当。这表明,虽然高秩分量用于优化图像细节,但这些线性算子中的主导奇异分量捕捉了语义内容,表明对于各种图像操纵,其表示具有一定程度的预测充分性。
-
研究论文将卷积神经网络拓扑结构与可训练性联系起来,而非仅仅层数
一篇新的研究论文探讨了卷积神经网络(CNN)的名义深度与其可训练性之间的关系,并引入了“有效深度”的概念。研究发现,虽然名义深度(层数)和有效深度都与准确率相关,但架构拓扑结构起着至关重要的作用。像ResNet和GoogLeNet这样的架构可以通过保持比其名义深度更低的有效深度来受益于增加的深度,这种现象被称为“有效深度悖论”。
-
论文探讨用于泰罗尼笔记识别的层次感知深度学习
一篇新论文探讨了使用分层深度学习模型来识别泰罗尼笔记,这是一种古老的拉丁速记系统。研究人员在手写和手稿样本上比较了 ResNet18 和 Vision Transformers 等标准分类器与层次感知模型。结果表明,在适应性有限的情况下,分层模型表现更好,而平面分类器在少样本适应方面表现出色。
-
基于知识蒸馏和GAN的6G机器人车辆网络增强
研究人员开发了一个名为KDG-SemNOMA的新型框架,用于6G机器人车辆网络,旨在在带宽和能源限制下提高视觉感知能力。该框架采用基于ConvNeXt的DeepJSCC架构,并带有用于信道自适应的注意力特征模块。为了减少干扰,采用了知识蒸馏策略,其中教师模型指导学生模型。此外,通道条件GAN对输出进行精炼,以生成具有逼真纹理的高保真图像,在准确性和感知质量方面均优于现有方法。
-
新的CGS方法增强了适用于移动部署的大型卷积核CNN
研究人员引入了一种称为通道组共享(CGS)低秩近似的新技术,以提高大型卷积神经网络(CNN)在移动设备上部署的效率。该方法通过使用基于奇异值分解(SVD)的参数共享策略,专注于优化逐点卷积,而逐点卷积构成了这些网络中绝大多数的参数。CGS方法降低了存储成本和内存带宽压力,使得RepLKNet、ConvNeXt和SLaK等预训练的大型卷积核模型能够切实地部署在资源受限的边缘设备上。
-
冻结基础模型嵌入实现标签高效水下图像分类
研究人员展示了一种使用冻结基础模型嵌入进行标签高效水下图像分类的方法。通过采用 DINOv3 ViT-B/16 嵌入,并仅在 AQUA20 基准测试上训练逻辑回归分类器,他们以显著降低的标注成本实现了具有竞争力的性能。即使每类只有 13 张标注图像,该方法也达到了 81.8% 的平均宏 F1 分数,接近使用整个训练集的完全监督方法的性能。
-
新的多模态学习提高了骨折分类的准确性
研究人员开发了一种多模态学习方法,以提高从X光片分类骨折的准确性,特别是在患者元数据不完整或不匹配的情况下。他们的方法结合了ConvNeXt图像编码器和临床多层感知器,并采用了可靠性门控残差融合和分层状态-位置公式。引入了解剖一致性门以减轻由不一致元数据引起的错误,在元数据混乱的条件下显著降低了性能损失。
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
新型 XtraLight-MedMamba 模型可高精度分类癌前息肉
研究人员开发了 XtraLight-MedMamba,一个新颖的深度学习框架,用于从全切片图像中分类肿瘤性管状腺瘤。该架构结合了 ConvNeXt 特征提取器和视觉 Mamba 块,以在全局上下文中有效地分析局部纹理。该模型包含一个空间和通道注意力桥接模块,用于增强多尺度特征提取,以及一个固定非负正交分类器,用于减少参数和提高泛化能力。与现有的 transformer 和 Mamba 模型相比,XtraLight-MedMamba 在…
-
新的AQUA20数据集旨在解决具有挑战性的水下物种分类问题
研究人员推出了AQUA20,这是一个旨在改进水下物种分类的新基准数据集。该数据集包含20种海洋物种的8,171张图像,经过专门策划,以应对浊度、低光照和遮挡等挑战。对十三种深度学习模型进行了实验,其中ConvNeXt在90.69%的Top-1准确率和88.92%的F1分数方面表现出最高的准确率,尽管其他模型也显示出不同的性能权衡。该研究还包括使用GRAD-CAM和LIME进行的解释性分析,以解释模型行为。
-
FFNet推出用于视觉任务的高效卷积混合器
研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。
-
新基准测试比较用于太阳辐照度预报的视觉骨干
一篇新研究论文介绍了一个可控的基准测试,用于评估多模态短期太阳辐照度预报中的视觉骨干。该研究固定了整体预报流程,并分离出视觉骨干进行比较,测试了ConvNeXt、Swin Transformer和各种基于Mamba的架构等模型。在Folsom和NREL数据集上的结果表明,虽然所有评估的骨干都优于智能持久性方法,但VMamba Small和Swin Base等特定模型取得了具有竞争力的RMSE值,尽管在NREL分割上智能持久性方法仍然最强。
-
和谐的心电图特征改善了跨数据集的临床预测
研究人员开发了一种用于心电图(ECG)波形的和谐可解释特征表示,以改善跨数据集的临床预测。这种称为FeatureDB的方法旨在减少在一家医院的数据上训练的模型应用于另一家医院数据时出现的性能下降,解决了协议和测量差异的问题。该研究评估了该方法在心力衰竭分类和死亡率预测等任务上的表现,发现与ConvNeXt等端到端深度学习模型相比,和谐特征在跨数据集迁移中保持了具有竞争力的性能并表现出更大的稳定性。
-
研究发现预训练域对私有医学图像AI至关重要
一篇新发表在arXiv上的研究调查了预训练数据对医学图像分析模型中隐私-效用权衡的影响。研究人员发现,与ImageNet等通用数据集相比,使用胸部X光片的预训练数据的域显著提高了差分隐私下的诊断准确性。即使预训练语料库本身是私有的,它仍然优于公共初始化,这表明在对医学成像模型应用隐私措施时,数据的来源比训练目标更关键。
-
基础模型使得车辆重识别的多分支融合效果减弱
一项新的研究论文对基础模型时代车辆重识别任务中多分支架构和不同骨干网络模型融合的有效性提出了质疑。研究发现,经过优化的单一DINOv3预训练ConvNeXt模型,其性能可与更复杂的多分支系统相媲美。进一步分析表明,组合多个分支或不同类型的骨干网络(如ConvNeXt和vision transformers)仅带来微小改进,这表明增强单个强大的基础模型骨干网络并采用检索阶段重排序是更有效的方法。
-
新的分层集成方法改进了斑马鱼表型分类
研究人员开发并评估了三种用于从胚胎图像分类斑马鱼表型的分层集成方法。该研究比较了三种骨干架构:ResNet18、ViT 和 ConvNeXt。ConvNeXt 在整体上表现出最高的性能,其中设置 2 中的专用分层集成在 F1 分数上实现了最佳平衡,表明其在斑马鱼表型识别方面的有效性。