Masked Autoencoder
PulseAugur coverage of Masked Autoencoder — every cluster mentioning Masked Autoencoder across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
CDG-MAE 使用扩散模型为计算机视觉生成合成视图
研究人员开发了 CDG-MAE,一种利用扩散模型生成的合成视图的新型计算机视觉自监督学习方法。该方法通过从静态图像创建不同的姿势和视角,解决了获取用于学习密集对应关系的各种训练数据的挑战。CDG-MAE 旨在弥合基于图像和基于视频的方法之间的性能差距,同时保留仅图像方法的 数据效率。
-
基础模型预训练策略影响视网膜成像迁移能力
一篇新的arXiv论文探讨了基础模型不同的预训练策略如何影响其在超广角视网膜成像任务上的迁移效果。研究人员比较了使用监督学习、掩码自编码器(MAE)和自蒸馏目标训练的Vision Transformer编码器。结果表明,监督学习和自蒸馏方法的表现优于MAE,其中大规模DINOv3模型在诊断糖尿病视网膜病变方面表现最佳。研究还发现,预训练策略会影响模型如何聚合来自不同图像块的证据,并且部分微调可以提高MAE的性能。
-
新的SPFM-Net框架以Mamba架构为目标,进行不可见水印攻击
研究人员开发了SPFM-Net,一个旨在攻击图像中不可见水印的新型框架。该系统利用语义先验引导和频率约束的Mamba架构,在保持图像质量的同时有效去除水印。SPFM-Net采用高比例掩蔽、微调的掩蔽自编码器以及基于Mamba的全局状态空间特征建模单元等技术来干扰和抑制水印信号。实验表明,SPFM-Net在各种水印方案中实现了攻击有效性和感知保真度之间的良好平衡。
-
视觉MAE适用于时间序列异常检测
研究人员开发了VAN-AD,一个新颖的时间序列异常检测框架,该框架改编了在ImageNet上预训练的视觉掩码自编码器(MAE)。该方法旨在提高跨不同数据集的泛化能力,尤其是在训练数据有限的情况下。VAN-AD包含一个自适应分布映射模块以增强异常模式的检测,以及一个归一化流模块来估计数据窗口的概率密度,在多个真实世界数据集上表现优于现有的最先进方法。
-
掩码自编码器以91.3%的准确率学习钢材缺陷识别
研究人员开发了一种新颖的无监督方法,使用基于Transformer的掩码自编码器来识别钢材表面缺陷。该方法通过掩盖75%的输入块并对其进行重构,从大量的无标签图像中学习表示,实现了0.92的结构相似性得分和0.47的均方误差。然后使用UMAP和Agglomerative聚类对学习到的特征进行聚类,最终在六种已知缺陷类别上实现了91.3%的匈牙利匹配准确率。
-
新的ProsMAE框架增强了组织病理学表示学习
研究人员开发了ProsMAE,一个新颖的多源掩码自编码器(Masked Autoencoder)框架,用于组织病理学表示学习。该方法利用来自PANDA、CAMELYON17和BRACS等不同数据集的图块来训练一个能够处理组织形态和采集条件变化的编码器。然后将预训练的编码器迁移用于ISUP分级分类,与标准的MAE基线相比,性能有所提高。
-
SleepMaMi:新型基础模型整合睡眠结构和生物信号
研究人员开发了SleepMaMi,这是一种新颖的睡眠基础模型,旨在整合长期睡眠结构和细粒度生物信号分析。该模型采用分层双编码器结构,其中宏观编码器用于处理时间依赖性,微观编码器用于处理信号形态。SleepMaMi在超过20,000份多导睡眠图记录上进行训练,在临床睡眠分析任务中表现出卓越的泛化能力和高效的适应性,性能优于现有的最先进模型。
-
CUPID深度伪造检测器使用紫外贴图和MAE进行可解释分析
研究人员开发了CUPID,一种新颖的深度伪造检测方法,该方法从3D面部模型重建紫外纹理贴图,并利用掩码自编码器(MAE)进行分析。该方法在训练期间不需要深度伪造视频或特定人物(POI)身份。与现有的最先进方法相比,CUPID在抗缩放和压缩等后处理技术方面表现出优越的性能和鲁棒性,同时通过解码的残差贴图提供了更快的推理时间和增强的可解释性。
-
新框架利用自监督学习,减少医学图像标注工作量
研究人员开发了一个名为 XSSR 的新框架,以减少跨不同域的医学图像标注工作量。该方法使用带有掩码自动编码器的自监督方法,从无标签的源数据中学习,然后根据密度、新颖性和多样性从目标域中选择代表性样本。然后,在这一小部分选定的样本上训练 U-Net 模型,其性能接近使用完全标注的数据。
-
新的 CA-LIG 框架增强了 Transformer 模型的可解释性
研究人员开发了一个名为上下文感知层级集成梯度 (CA-LIG) 的新框架,以提高 Transformer 模型的可解释性。该框架提供了一种统一的分层方法,计算层级归因并将其与注意力梯度融合。CA-LIG 旨在为这些模型在各种任务和架构中做出决策提供更忠实、更具上下文敏感性且语义一致的解释。
-
新框架通过双模型方法提升医学图像分类性能
研究人员开发了一种新的深度学习框架,用于医学图像分类,该框架结合了自监督学习和迁移学习技术。该方法使用了两个ConvNeXt-Tiny模型,一个在ImageNet上预训练,另一个在医学数据上使用熵引导的掩码自编码器进行训练。两种模型概率的集成策略(平均法)在四个医学成像数据集上取得了最先进的结果,优于单个模型和现有方法。