Swin Transformer
PulseAugur coverage of Swin Transformer — every cluster mentioning Swin Transformer across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
自适应MoE Swin Transformer增强无线图像传输
研究人员开发了一种新颖的自适应语义通信系统,用于无线图像传输,该系统在Swin Transformer架构中利用了混合专家(MoE)机制。该系统通过同时考虑图像内容和实时信道条件,将图像数据动态路由到专门的专家,克服了先前单一驱动路由方法的局限性。仿真结果表明,与现有方法相比,图像重建质量和传输效率得到了显著提高。
-
新AI框架增强航空发动机叶片缺陷检测能力
研究人员开发了一个名为航空发动机叶片缺陷检测器(ABDD)的新框架,以提高航空发动机叶片制造中视觉检测的准确性。该系统采用双对齐策略来适应生产线和成像条件的变化,解决了域偏移带来的挑战。ABDD包含一个不确定性感知框过滤机制,以减轻不可靠预测带来的错误,以及一个稀疏扩张Mona模块用于高效参数调整。在基准数据集和工业平台上的实验结果表明,ABDD在域偏移下具有增强的鲁棒性。
-
新的SRTS-BCE方法在数据有限的情况下提高了AI分类器的校准性能
研究人员开发了一种名为信号路由温度缩放(SRTS-BCE)的新方法,用于提高AI分类器的校准性能,特别是在验证数据有限的情况下。该技术引入了一种低容量、风险条件的校准器,在校准预算较小时,其性能优于传统的标量方法,甚至优于更高容量的自适应方法。SRTS-BCE在CIFAR-100等数据集上使用ViT-B/16等模型取得了更好的性能,证明了其在数据受限场景下的有效性。
-
论文探讨用于泰罗尼笔记识别的层次感知深度学习
一篇新论文探讨了使用分层深度学习模型来识别泰罗尼笔记,这是一种古老的拉丁速记系统。研究人员在手写和手稿样本上比较了 ResNet18 和 Vision Transformers 等标准分类器与层次感知模型。结果表明,在适应性有限的情况下,分层模型表现更好,而平面分类器在少样本适应方面表现出色。
-
CLFTv2:高效的相机-激光雷达融合用于自动驾驶
研究人员推出CLFTv2,一个用于自动驾驶语义分割的高级框架,可高效融合相机和激光雷达数据。该新模型用基于Swin的编码器和轻量级残差解码器取代了全局ViT注意力,在2D视角域操作以整合多尺度几何线索。CLFTv2在多个数据集上展示了对弱势道路使用者的召回率的提高,在ZOD和Waymo上取得了高mIoU分数,同时比以前的模型更具计算效率。
-
新框架在无人为标注的情况下从视频运动中学习物体概念
研究人员开发了一个新颖的框架,该框架可以从原始视频中学习以物体为中心的视觉表示,而无需人工注释或相机校准。该方法利用光流的运动边界和聚类来生成伪实例掩码,然后监督单图像编码器。该框架在海量视频帧数据集上进行了训练,并通过运动验证的自训练得到增强,从而在深度估计和物体检测等各种下游任务上取得了具有竞争力或更优越的性能。
-
新框架结合流形学习技术增强图像检索能力
研究人员开发了一个新的内容基础图像检索(CBIR)框架,该框架结合了基于投影和基于排名的流形学习策略。该方法将均匀流形逼近与投影(UMAP)生成的替代低维特征表示与使用Borda Count方法重新排序的列表进行聚合。使用ResNet152、Swin Transformer和DINOv2模型的特征进行的实验证明了检索效果的提高,特别是在基线表示在精度方面遇到困难的情况下。
-
混合 AI 模型在检测 GAN 生成人脸方面达到 99% 的准确率
研究人员开发了一种新颖的混合架构,该架构结合了 EfficientNet-B0 的卷积处理和 Swin Transformer 后端,以更有效地检测 GAN 生成的合成人脸。该新模型在 5,000 张测试图像的数据集上达到了 99% 的准确率和 99.44% 的召回率,优于先前的方法。研究表明,将分层 CNN 特征与移位窗口自注意力相结合,为识别深度伪造图像提供了一种计算量轻且有效的方法。
-
新型SFG-SwinSR模型提升遥感图像超分辨率
研究人员开发了一种名为SFG-SwinSR的新模型,该模型通过引入空间-频率门控前馈网络来增强遥感图像超分辨率。这种新颖的方法区分低频结构和残差细节,并进行自适应细化。在SEN2VENμS、OLI2MSI和SEN2NAIP等跨传感器基准上进行测试,SFG-SwinSR在现有基于Swin的方法上表现出持续的改进,为结构感知超分辨率提供了轻量级但有效的归纳偏置。
-
新框架使AI模型能够从稀疏视觉数据中识别材料
一个名为稀疏表面理解框架(SSUF)的新框架已被开发出来,用于从不完整的视觉数据中改进材料识别。SSUF同时适配了四个预训练架构——ConvAE、ViT、Swin Transformer和MAE——用于表面重建和材料分类。在仅使用10%可见图像数据的Touch-and-Go数据集上进行的实验表明,Swin Transformer在分类准确率上达到了最高的89.21%,而MAE在重建方面表现出色。ViT提供了均衡的性能,所有模型都展示了…
-
新AI框架通过多尺度图像分析增强儿童肿瘤诊断
研究人员开发了CoPath,一个用于通过病理图像精确轻量级诊断周围神经母细胞瘤(pNTs)的新型框架。CoPath集成了CoHisNet,一个利用Kolmogorov-Arnold网络改进非线性特征建模的多尺度特征融合网络,以及PathVote,它结合了病理学先验信息将斑块级预测聚合为全切片图像决策。该方法解决了儿童肿瘤队列有限、组织学异质性和计算负担等挑战,与现有方法相比,在较低的复杂度下实现了有竞争力的性能。
-
新研究探索先进的机器学习遗忘技术 · 追踪4个来源
研究人员正在开发新的机器学习遗忘方法,即从AI模型中移除特定数据或知识的过程。一种名为源无关类别遗忘审计(SFRA)的方法,专注于在无法访问原始训练数据的情况下,利用合成探针和置信度过滤来恢复已遗忘类别的模型。另一种方法,CONfession-to-Forget-Set(CONFS),通过构建与模型对齐的遗忘集来解决大型语言模型(LLMs)中的遗忘集不对齐问题,以提高隐私性和可用性。此外,GRACE(梯度引导核心集选择)解决了从有限示…
-
新方法增强LoRA在模型适应中的效率和稳定性
研究人员开发了两种新方法来提高参数高效模型适应中使用的低秩适应(LoRA)技术的效率和稳定性。归一化低秩适应(NoRA)在训练期间对降维矩阵进行归一化,以加速收敛并提高性能,而无需增加参数或计算开销。LoRA的激活边界匹配(ABM-LoRA)使用任务诱导的激活边界符号作为新适配器的目标,提高了LoRA对初始化的敏感度,并在各种基准测试中优于标准LoRA。
-
深度学习方法提高了卵巢超声分类的准确性
研究人员开发了一种病灶引导的感兴趣区域(ROI)深度学习方法,用于卵巢超声分类,在减少标注工作量的同时实现了高准确性。该方法在MMOTU和OUD两个数据集上进行了评估,使用了各种深度学习架构和传统机器学习分类器。病灶引导的ROI策略,特别是与MaxViT-Tiny模型结合使用时,表现出卓越的性能,在MMOTU上准确率为93.10%,在OUD上准确率为97.56%。
-
Iwin Transformer 通过交错窗口和卷积解决了 ViT 的复杂性问题
研究人员推出了一种新颖的层次化视觉Transformer——Iwin Transformer,旨在克服现有视觉Transformer(ViTs)的局限性。这种新架构在一个块内结合了交错窗口注意力和深度卷积,有效降低了注意力机制的二次复杂度。Iwin Transformer 还实现了增强的可扩展性,能够支持在不同分辨率下的微调以及从2D到3D应用的权重迁移。初步结果显示,在ImageNet-1K上的准确率有所提高,在Kinetics-4…
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
SCOUT框架支持对人脸识别模板进行直接语义编辑
研究人员推出了一种新颖的框架SCOUT,旨在发现和直接操纵人脸识别模板中的语义概念。该方法利用机制可解释性来学习稀疏模板表示,并根据自然语言描述生成语义假设。SCOUT能够进行可控的、身份感知的模板编辑,而无需昂贵的重新编码过程,并在包括具有CNN、ViT和Swin骨干的各种人脸识别模型上证明了其有效性。
-
使用X射线图像对夏威夷果进行质量评估的深度学习基准
研究人员开发了一个用于使用X射线图像对夏威夷果质量进行分类的深度学习基准。该研究涉及799张分割的X射线图像,评估了各种单一模型配置和集成模型。一个结合了使用二元交叉熵训练的卷积神经网络和冻结的Swin Transformer的集成模型达到了86.3%的最高平衡准确率。研究结果强调了深度学习在自动化农业质量评估方面的潜力,并突出了对小型、不平衡数据集进行严格评估和数据整理的必要性。
-
新的乳腺钼靶数据集和泛化框架提高了AI准确性
研究人员引入了两个新的数据集BreastMammo和DenseMammo,旨在提高AI模型在不同临床地点乳腺钼靶检查中的泛化能力。他们还提出了一个使用前景直方图匹配来解决图像采集风格差异的领域泛化框架。该方法在采用Swin Transformer骨干网络进行测试时,在密度分类方面达到了98.32%的AUC,并在外部数据集上优于MixStyle和基于离散傅里叶变换的框架等现有方法。
-
大脑核磁共振基础模型主要编码采集位点,而非解剖结构
研究人员发现,当冷冻基础模型用于表示大脑核磁共振数据时,它们主要编码核磁共振采集的位点,而不是解剖或临床信息。这种效应在不同的队列、编码器和网络深度中都有观察到,即使是从随机初始化的模型或原始图像中,位点信息也高度可解码。虽然 ComBat 等方法可以去除这种位点指纹,但代价是会在共享子空间中将位点和解剖信息纠缠在一起。该研究建议对基础模型进行位点归因审计,并为此提供了一个开放的工具包。