Swin Transformer
PulseAugur coverage of Swin Transformer — every cluster mentioning Swin Transformer across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
SCOUT框架支持对人脸识别模板进行直接语义编辑
研究人员推出了一种新颖的框架SCOUT,旨在发现和直接操纵人脸识别模板中的语义概念。该方法利用机制可解释性来学习稀疏模板表示,并根据自然语言描述生成语义假设。SCOUT能够进行可控的、身份感知的模板编辑,而无需昂贵的重新编码过程,并在包括具有CNN、ViT和Swin骨干的各种人脸识别模型上证明了其有效性。
-
使用X射线图像对夏威夷果进行质量评估的深度学习基准
研究人员开发了一个用于使用X射线图像对夏威夷果质量进行分类的深度学习基准。该研究涉及799张分割的X射线图像,评估了各种单一模型配置和集成模型。一个结合了使用二元交叉熵训练的卷积神经网络和冻结的Swin Transformer的集成模型达到了86.3%的最高平衡准确率。研究结果强调了深度学习在自动化农业质量评估方面的潜力,并突出了对小型、不平衡数据集进行严格评估和数据整理的必要性。
-
新的乳腺钼靶数据集和泛化框架提高了AI准确性
研究人员引入了两个新的数据集BreastMammo和DenseMammo,旨在提高AI模型在不同临床地点乳腺钼靶检查中的泛化能力。他们还提出了一个使用前景直方图匹配来解决图像采集风格差异的领域泛化框架。该方法在采用Swin Transformer骨干网络进行测试时,在密度分类方面达到了98.32%的AUC,并在外部数据集上优于MixStyle和基于离散傅里叶变换的框架等现有方法。
-
大脑核磁共振基础模型主要编码采集位点,而非解剖结构
研究人员发现,当冷冻基础模型用于表示大脑核磁共振数据时,它们主要编码核磁共振采集的位点,而不是解剖或临床信息。这种效应在不同的队列、编码器和网络深度中都有观察到,即使是从随机初始化的模型或原始图像中,位点信息也高度可解码。虽然 ComBat 等方法可以去除这种位点指纹,但代价是会在共享子空间中将位点和解剖信息纠缠在一起。该研究建议对基础模型进行位点归因审计,并为此提供了一个开放的工具包。
-
深度学习模型用于乳腺癌检测的性能和排放基准测试
一篇新论文对七种用于乳腺癌检测的深度学习模型进行了基准测试,评估了它们的性能和环境影响。研究发现,虽然EfficientNet和ResNet提供了高准确率,但它们也产生了更高的二氧化碳排放。DeiT-Tiny、ViT和Swin Transformer等Transformer模型取得了有竞争力的结果,其中DeiT-Tiny在一个数据集上提供了准确率和能源效率的良好平衡,而ViT和Swin在另一个数据集上表现出色。研究强调,在选择医学应用…
-
新方法加速 Vision Transformer 在边缘设备的适配
研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。
-
Swin Transformer和临床数据提升皮肤病变分类准确性
研究人员开发了一种新的多模态皮肤病变分类框架,旨在提高皮肤癌的早期诊断率。该方法将Swin Transformer提取的视觉特征与结构化临床元数据相结合。在公开数据集上的实验显示,测试准确率为92.55%,宏观F1分数达到91.33%,即使在少数类上表现也强劲。该模型还结合了温度缩放以进行校准和不确定性估计,以增强预测的可靠性和置信度。
-
CoInS-Net 通过联合插值和分割推进医学图像分析
研究人员开发了 CoInS-Net,这是一种专为医学图像的同步插值和分割而设计的新型网络。该方法解决了现有独立处理这些任务的方法的局限性,这些方法会导致冗余计算和遗漏跨切片信息。CoInS-Net 利用共享的 Swin 编码器和双向交互,使任务能够相互加强共同的解剖结构,同时保留不同的需求。
-
合成数据框架InsCore预训练工业分割模型
研究人员开发了InsCore,一个用于预训练工业分割任务的视觉基础模型的合成数据生成框架和数据集。该方法解决了真实世界工业数据集的挑战,如领域差异、商业使用限制和资源限制。InsCore采用公式驱动的监督学习构建,专注于遮挡处理,并已证明其性能可与在ImageNet-21k上预训练的模型相媲美,尽管使用的数据量显著减少且不包含真实图像。
-
新的APQF框架通过LLM引导自动化AI模型压缩
研究人员开发了APQF,这是一个旨在优化深度神经网络在边缘设备上效率的自动化框架。该系统采用一种代理方法,由LLM规划器和剖析数据引导,以逐层确定最佳的结构化剪枝和混合精度量化策略。APQF旨在显著降低计算成本,同时保持高精度,在多个数据集上的各种视觉模型上展示了位运算的大幅减少。
-
EfficientViT-M2 在鲁棒在轨卫星图像分类中领先
一项比较研究评估了14种不同的计算机视觉模型,包括各种视觉Transformer(ViT)架构,用于地球观测任务中的在轨卫星图像分类。研究侧重于准确性、计算效率、功耗以及对传输退化的鲁棒性。EfficientViT-M2 成为一个有力的候选者,在准确性、低功耗和对噪声及压缩的抵抗力方面提供了良好的平衡,使其适用于资源受限的在轨系统。
-
新的AI框架通过详细信号分析提高睡眠分期准确性 · 跟踪2个来源
研究人员正在开发自动睡眠分期的先进方法,超越传统的30秒周期分析。一种方法利用隐半马尔可夫模型将粗略的周期标签转换为秒级注释,通过利用睡眠阶段边界附近的细微信号变化来提高准确性。另一种方法SWINSleepNet采用分层、上下文感知的框架,同时使用时域EEG信号和时频变换以及Swin Transformer来捕捉精细的时间细节和长距离依赖关系,在具有挑战性的睡眠阶段和转换方面表现出改进的性能。
-
LLM 通过新颖的语言注入模块增强食物图像分割
研究人员开发了两个新颖的模块 LIM-F 和 LIM-Q,通过整合源自大型语言模型 (LLM) 的食材标签来增强食物图像分割。这些模块可以添加到现有的图像编码器和解码器中,而无需预先对齐的图像-文本数据。当应用于 FoodSeg103 基准测试时,所提出的方法取得了最先进的结果,其中 LIM-Q 和 Swin-L 编码器达到了 55.0 mIoU。该方法还证明了其在基于 CNN 的架构上的有效性,并且 GPU 内存使用量仅有适度增加。
-
新基准测试比较用于太阳辐照度预报的视觉骨干
一篇新研究论文介绍了一个可控的基准测试,用于评估多模态短期太阳辐照度预报中的视觉骨干。该研究固定了整体预报流程,并分离出视觉骨干进行比较,测试了ConvNeXt、Swin Transformer和各种基于Mamba的架构等模型。在Folsom和NREL数据集上的结果表明,虽然所有评估的骨干都优于智能持久性方法,但VMamba Small和Swin Base等特定模型取得了具有竞争力的RMSE值,尽管在NREL分割上智能持久性方法仍然最强。
-
新AI模型增强了用于放射治疗计划的MRI到CT合成
研究人员开发了一种名为Parallel Swin Transformer-Enhanced Med2Transformer的新型3D架构,以改进用于放射治疗计划的MRI数据到CT图像的合成。该模型集成了卷积编码和双Swin Transformer分支,以更好地捕捉局部解剖细节和长距离上下文依赖关系,利用多尺度移位窗口注意力和分层特征聚合。在公共和临床数据集上的实验表明,所提出的方法与现有方法相比,实现了更高的图像相似性和几何精度,临床…
-
首次发布 Vision Transformers 的机器遗忘基准测试
一篇新的研究论文介绍了首个专门为 Vision Transformers (VTs) 设计的机器遗忘 (MU) 基准测试。该研究弥补了 MU 研究的空白,因为该领域的研究主要集中在卷积神经网络 (CNNs) 上,而不是计算机视觉中日益流行的 VTs。该基准测试采用了各种数据集、MU 算法和协议,为比较 VTs 上 MU 算法的性能提供了一种标准化且可复现的方法,为未来的研究奠定了参考基线。
-
新AI框架BUSTR利用有限数据生成乳腺超声报告
研究人员开发了BUSTR,一个用于生成乳腺超声(BUS)报告的新型视觉语言学习框架。该系统旨在通过利用结构化的病灶信息(如BI-RADS分类、形状和回声特征)来生成报告,从而克服成对图像和放射科医生书写报告数据稀缺的问题。BUSTR采用Swin Transformer编码器和基于LLaMA的语言模型,并使用结合了token级和表示级对齐的双层目标进行训练。与现有方法相比,该框架在报告相似性和描述符恢复方面表现出改进,特别是在病灶形状、…
-
新的MAGE框架提高了胃部肿瘤分类的准确性
研究人员开发了一个名为Masked Achromatic Guidance Expert (MAGE) 的新框架,用于对胃部肿瘤进行分类。MAGE采用双目标蒸馏策略,迫使模型学习结构特征,而不是依赖颜色或背景偏差。这种方法旨在通过提供更可靠和可解释的注意力图来提高内窥镜检查的诊断准确性。
-
ScratNet:新型AI模型增强半导体划痕检测能力
研究人员开发了ScratNet,一个新颖的深度学习框架,用于精确分割半导体制造中的划痕缺陷。该端到端系统采用了一个改进的Swin Transformer骨干网络和一个专门的解码器,该解码器集成了多尺度空洞聚合、一个Stem集成模块和一个精度细化分支。ScratNet旨在通过增强边界清晰度和捕捉细粒度边缘细节,来改善对不规则、低对比度和不同尺度划痕的检测,并在实验评估中超越了现有方法。