ConvNeXt
PulseAugur coverage of ConvNeXt — every cluster mentioning ConvNeXt across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
新型 XtraLight-MedMamba 模型可高精度分类癌前息肉
研究人员开发了 XtraLight-MedMamba,一个新颖的深度学习框架,用于从全切片图像中分类肿瘤性管状腺瘤。该架构结合了 ConvNeXt 特征提取器和视觉 Mamba 块,以在全局上下文中有效地分析局部纹理。该模型包含一个空间和通道注意力桥接模块,用于增强多尺度特征提取,以及一个固定非负正交分类器,用于减少参数和提高泛化能力。与现有的 transformer 和 Mamba 模型相比,XtraLight-MedMamba 在…
-
新的AQUA20数据集旨在解决具有挑战性的水下物种分类问题
研究人员推出了AQUA20,这是一个旨在改进水下物种分类的新基准数据集。该数据集包含20种海洋物种的8,171张图像,经过专门策划,以应对浊度、低光照和遮挡等挑战。对十三种深度学习模型进行了实验,其中ConvNeXt在90.69%的Top-1准确率和88.92%的F1分数方面表现出最高的准确率,尽管其他模型也显示出不同的性能权衡。该研究还包括使用GRAD-CAM和LIME进行的解释性分析,以解释模型行为。
-
FFNet推出用于视觉任务的高效卷积混合器
研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。
-
新基准测试比较用于太阳辐照度预报的视觉骨干
一篇新研究论文介绍了一个可控的基准测试,用于评估多模态短期太阳辐照度预报中的视觉骨干。该研究固定了整体预报流程,并分离出视觉骨干进行比较,测试了ConvNeXt、Swin Transformer和各种基于Mamba的架构等模型。在Folsom和NREL数据集上的结果表明,虽然所有评估的骨干都优于智能持久性方法,但VMamba Small和Swin Base等特定模型取得了具有竞争力的RMSE值,尽管在NREL分割上智能持久性方法仍然最强。
-
和谐的心电图特征改善了跨数据集的临床预测
研究人员开发了一种用于心电图(ECG)波形的和谐可解释特征表示,以改善跨数据集的临床预测。这种称为FeatureDB的方法旨在减少在一家医院的数据上训练的模型应用于另一家医院数据时出现的性能下降,解决了协议和测量差异的问题。该研究评估了该方法在心力衰竭分类和死亡率预测等任务上的表现,发现与ConvNeXt等端到端深度学习模型相比,和谐特征在跨数据集迁移中保持了具有竞争力的性能并表现出更大的稳定性。
-
研究发现预训练域对私有医学图像AI至关重要
一篇新发表在arXiv上的研究调查了预训练数据对医学图像分析模型中隐私-效用权衡的影响。研究人员发现,与ImageNet等通用数据集相比,使用胸部X光片的预训练数据的域显著提高了差分隐私下的诊断准确性。即使预训练语料库本身是私有的,它仍然优于公共初始化,这表明在对医学成像模型应用隐私措施时,数据的来源比训练目标更关键。
-
基础模型使得车辆重识别的多分支融合效果减弱
一项新的研究论文对基础模型时代车辆重识别任务中多分支架构和不同骨干网络模型融合的有效性提出了质疑。研究发现,经过优化的单一DINOv3预训练ConvNeXt模型,其性能可与更复杂的多分支系统相媲美。进一步分析表明,组合多个分支或不同类型的骨干网络(如ConvNeXt和vision transformers)仅带来微小改进,这表明增强单个强大的基础模型骨干网络并采用检索阶段重排序是更有效的方法。
-
新的分层集成方法改进了斑马鱼表型分类
研究人员开发并评估了三种用于从胚胎图像分类斑马鱼表型的分层集成方法。该研究比较了三种骨干架构:ResNet18、ViT 和 ConvNeXt。ConvNeXt 在整体上表现出最高的性能,其中设置 2 中的专用分层集成在 F1 分数上实现了最佳平衡,表明其在斑马鱼表型识别方面的有效性。
-
AI系统在视频分析中提升矛盾和犹豫识别能力 · 跟踪8个来源
研究人员开发了识别视频中矛盾和犹豫的先进方法,参加了第11届ABAW挑战赛。其中一种方法,HSEmotion团队的系统,利用多任务学习,结合冻结的轻量级面部提取器和后处理技术来预测效价、唤醒度、面部表情和动作单元。另一个系统SVF-CR采用同步视觉-面部交叉精炼框架进行多模态证据融合。第三种方法侧重于简单特征和诚实校准,引入“ASR擦除时间”来捕捉犹豫停顿,并使用称为情感标记融合的可靠性门控。
-
新的SEAMS方法识别出对AI模型行为至关重要的图像区域
研究人员开发了SEAMS,一种新颖的显著性方法,旨在识别对保留模型行为至关重要的图像区域。该方法使用保留目标来优化软掩码,直接搜索能够维持特定模型输出(如类别概率或嵌入)的紧凑掩码。SEAMS无需辅助数据集或特定于架构的机制即可运行,展示了其在ViT-S/16和ConvNeXt等不同模型上的灵活性。该方法生成稳定、可解释且具有竞争力的显著图,表明视觉解释可能依赖于架构。
-
AI 系统 EcoVision 使用无人机图像进行盐沼植被测绘
研究人员开发了 EcoVision,这是一个利用无人机图像进行盐沼植被监测的 AI 驱动系统。该系统采用基于 Transformer 的语义分割和 ConvNeXt 架构,对 Spartina maritima 和 Puccinellia maritima 进行精细物种分类。EcoVision 的优势度估算与实地调查结果高度一致,为可扩展、高分辨率的生态监测提供了一种实用的方法。
-
新的LFNet方法融合CNN和SSM特征以改进显著目标检测
研究人员开发了一种名为Liquid Fusion Network (LFNet) 的新方法,通过协调不同神经网络架构的特征来改进显著目标检测。LFNet利用受Liquid Neural Networks启发的液态融合方法,解决了卷积神经网络 (CNN) 和状态空间模型 (SSM) 中固有的频谱偏差。这种动态集成允许内容感知的特征聚合,并且可以扩展到多模态线索,从而在各种任务中实现最先进的性能。
-
深度学习模型改进早产儿呼吸暂停检测
研究人员开发了深度学习模型,以更准确地检测新生儿重症监护室中早产儿的呼吸暂停事件。这些模型利用阻抗容积描记图 (IP)、心电图 (ECG) 和光电容积描记图 (PPG) 信号,在性能上优于传统的基于阈值的监测。结合 IP 和 PPG 信号的 ConvNeXt 架构实现了最高的 88.7% 平衡准确率,凸显了深度学习在分析复杂生理数据以进行关键婴儿监测方面的有效性。
-
AI迁移攻击:“剪刀效应”揭示多样性阻碍鲁棒模型
研究人员在针对AI模型的迁移攻击中发现了一种称为“剪刀效应”的现象。该效应表明,虽然随机调整大小和填充(输入多样性或DI)通常能提高标准模型的攻击成功率,但它们会严重阻碍对鲁棒训练模型的攻击。这一反直觉的发现是在CNN、ViT和Swin Transformer等各种模型架构以及ImageNet和CIFAR-10等数据集上观察到的,表明DI的有效性高度依赖于模型的训练机制。研究将这种效应归因于梯度的几何特性,其中调整大小被认为是导致鲁棒…
-
新的胶囊架构提高了注视估计的准确性和速度
研究人员开发了 CapStARE,一种用于注视估计的新型基于胶囊的架构。该系统利用冻结的 ConvNeXt 主干进行高效特征提取,并通过基于注意力的路由形成胶囊,以进行结构化的面部推理。它采用双 GRU 解码器进行轻量级序列建模,在 ETH-XGaze 和 MPIIFaceGaze 等基准数据集上实现了实时推理速度和强大的性能。
-
新研究增强了稀疏自编码器的可解释性和鲁棒性
研究人员正在探索新方法来提高稀疏自编码器(SAE)的可解释性和鲁棒性。一种名为GRILL的方法旨在通过在对抗性鲁棒性评估期间恢复退化的梯度信号来揭示自编码器的隐藏漏洞。其他工作侧重于分析稀疏性和叠加对SAE损失的影响,引入可训练的有理函数作为编码器激活以增强灵活性,并提出余弦评分作为归一化表示上字典学习的默认方法。此外,研究正在调查SAE集成以改善重建误差和稳定性,并探索权重正则化技术以增加跨种子特征的一致性和可控性。
-
新AI模型提高医学图像分割精度
研究人员开发了两个新颖的框架SAGE和SegMoTE,以改进医学图像分割。SAGE利用动态专家路由系统来适应细胞大小和形状的变化,在多个数据集上取得了高Dice分数。另一方面,SegMoTE以最少的学习参数和降低的标注成本,有效地将SAM等通用分割模型应用于医学成像任务。这两种方法都旨在提高AI在临床诊断中的准确性和实用性。
-
Samudra 2 神经模拟器提升海洋气候模型精度
研究人员开发了 Samudra 2,这是一种先进的海洋环流模型神经模拟器,可显著提高准确性和速度。该新模型通过采用更宽的 U-Net 主干和动态损失函数,解决了其前身在方差崩溃和印记伪影等方面的局限性。Samudra 2 在预测海洋温度方面实现了更高的准确性,并且能够模拟更长时间尺度下更精细的分辨率,从而能够进行更广泛的气候研究。
-
FAF-CD框架提高了遥感图像变化检测的准确性
研究人员开发了FAF-CD,一种用于遥感图像变化检测的新型框架,在处理不完美和异构观测数据时尤其有效。该系统利用了DINOv3预训练编码器和基于VMamba的解码器,并包含一个融合模块,该模块可以对齐空间数据并使用傅里叶和Haar小波变换比较频率信息。FAF-CD在包括EO-SAR灾害测绘和光学变化检测在内的各种数据集上,均显示出比现有方法更高的准确性和效率。