ADE20K
PulseAugur coverage of ADE20K — every cluster mentioning ADE20K across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
ViTok 模型增强计算机视觉蒸馏中的密集语义
研究人员开发了 ViTok,一种新的模型,可改进计算机视觉任务中多教师蒸馏的密集语义。通过结合 SigLIP2 和 DINOv3-L 的见解,ViTok 解决了全局识别和密集语义准确性之间的权衡问题。该模型包含多项修改,包括拆分适配器头、不对称损失和掩码图像建模,在 ImageNet-1K 和 ADE20K 基准测试中取得了强劲的性能。
-
视觉 Transformer 显示出具有有限空间范围的涌现式物体绑定能力
研究人员发现视觉 Transformer (ViTs) 表现出一种涌现式的“物体绑定”能力,使它们能够辨别不同的图像块是否属于同一个物体。然而,这种能力在空间上是有限的,随着图像块之间距离的增加,绑定信号会显著减弱。这种有限的空间范围及其相关的基线在各种物体大小、ADE20K 和 COCO 等数据集以及 DINO 和 CLIP 等不同的模型骨干网络中都保持一致,这表明它是所学表征的一种内在属性。
-
稀疏自编码器赋能基础模型的视觉科学发现
研究人员开发了一种使用稀疏自编码器(SAEs)从基础模型中识别和排序视觉特征的方法,无需预先指定的概念即可实现科学发现。该方法在三个阶段进行了测试:一般概念再发现、领域特定概念再发现和驱动式特征排序。在ADE20K、FishVista和Heliconius butterflies等数据集上的评估中,与k-means聚类、PCA和SemiNMF等传统方法相比,SAEs在揭示模型表示中的语义结构方面表现更优。
-
无监督MoSA框架从运动数据中学习物体分割
研究人员开发了基于运动的万物分割(MoSA)框架,这是一个无监督框架,旨在克服像Segment Anything Model(SAM)这样的模型对海量手动标注的依赖。MoSA利用未标记的视频从运动中学习物体概念,通过生成运动伪标签、使用对比学习训练感知分组模型(PGM)以及将这些知识转移到用于图像分割的提示引导架构等阶段进行。在COCO和ADE20K等基准测试上的评估表明,MoSA的性能显著优于其他无监督方法,并达到了与监督式SAM相…
-
VisionHOPE:发布新的视觉骨干模型及预训练权重
一篇新的研究论文介绍VisionHOPE,一个被设计为自修改学习系统的视觉骨干模型。该论文提供了VisionHOPE不同尺寸(T/S/B)检查点的官方预训练权重。这些检查点可用于ImageNet-1K分类、COCO目标检测和实例分割以及ADE20K语义分割等任务。用户可以使用Hugging Face CLI下载单个或所有检查点。
-
G2TM 方法提升了 Vision Transformer 在不同架构下的效率
研究人员对图引导令牌合并 (G2TM) 方法进行了系统性研究,该方法旨在通过降低与自注意力机制相关的二次复杂度来提高 Vision Transformer (ViT) 的效率。研究发现,G2TM 的有效性主要是编码器的一个属性,在各种解码器架构以及语义分割和图像分类等任务中保持一致。G2TM 的最佳超参数取决于骨干网络的预训练和目标数据集,而不是解码器的选择,从而显著降低了分割模型的 GFLOPs 并提高了吞吐量。
-
新的CTOAC方法改进了视觉状态空间对偶模型的低比特量化
研究人员开发了一种新的后训练量化(PTQ)方法,称为通道感知、Token平衡、输出感知裁剪(CTOAC),以解决视觉状态空间对偶(VSSD)模型中的低比特量化挑战。该研究确定激活量化是关键瓶颈,并提出CTOAC学习每输入通道的裁剪边界,从而最小化重建损失。该方法在各种VSSD模型尺寸的激进精度设置下成功保持了ImageNet-1K的准确性并提高了鲁棒性,同时在COCO和ADE20K数据集上的目标检测和分割任务中也保持了性能。在RTX …
-
TailProp 提出用于视觉模型的自适应传播方法
研究人员推出了一种新颖的层次化视觉骨干网络 TailProp,该网络利用了尾传播算子 (TPO)。TPO 结合了高斯和柯西稳定过程传播器,能够根据内容实现自适应的空间影响。这种方法在图像分类、目标检测和语义分割等各种计算机视觉任务中取得了改进的性能,优于现有的传播基线。
-
LookThere! Sparse Vision by Reinforced Selection 框架通过强化选择减少计算量
研究人员开发了 LookThere,一个新颖的框架,它使用强化学习使视觉 Transformer 仅处理最相关的图像 token。通过训练一个独立的输入选择器和表示提取器,该方法显著降低了计算负荷,使模型能够在不依赖启发式方法的情况下学习关注点和查看内容。LookThere 展现出令人印象深刻的效率,仅使用 0.2% 的输入 token 即可保持准确性,并在分类、分割和回归等各种计算机视觉任务中表现出强大的泛化能力。
-
新的SELECT方法解决了语义分割中的灾难性遗忘问题
研究人员推出了一种新颖的类别增量语义分割(CISS)方法SELECT,旨在减轻灾难性遗忘和背景偏移。该方法通过上下文迁移注意力机制将新类学习与语义上相似的过去类联系起来,该机制聚合学习到的令牌以进行结构化初始化。为了保持表示的完整性,SELECT采用了受控噪声扰动和基于边距的损失函数。在Pascal VOC和ADE20K数据集上的实验表明,SELECT的性能优于现有方法,mIoU得分有所提高。
-
GramLoop框架在分布偏移下提升DINOv3密集预测模型
研究人员开发了GramLoop,一个旨在提高冻结的DINOv3密集预测模型在面对分布偏移时性能的新型框架。该方法在视觉骨干网络中集成了额外的计算,而不改变模型的权重或特定任务的组件。GramLoop通过重放Transformer层的一部分并强制通过Gram矩阵实现一致性,从而在保持空间关系的同时优化特征。实验表明,在包括COCO-O上的显著提升在内的各种偏移基准测试中,物体检测和语义分割都有显著改进,同时不会损害干净的ADE20K数据上的性能。
-
新的源编解码器在低比特率下增强了分布式语义分割
研究人员开发了两种新颖的源编解码器,以提高分布式深度神经网络在语义分割中的率失真性能,尤其是在极低比特率下。这些编解码器能够实现边缘设备和云平台之间的有效传输,在ADE20K和Cityscapes数据集上实现了低于每像素0.2比特的最新结果。
-
Iwin Transformer 通过交错窗口和卷积解决了 ViT 的复杂性问题
研究人员推出了一种新颖的层次化视觉Transformer——Iwin Transformer,旨在克服现有视觉Transformer(ViTs)的局限性。这种新架构在一个块内结合了交错窗口注意力和深度卷积,有效降低了注意力机制的二次复杂度。Iwin Transformer 还实现了增强的可扩展性,能够支持在不同分辨率下的微调以及从2D到3D应用的权重迁移。初步结果显示,在ImageNet-1K上的准确率有所提高,在Kinetics-4…
-
新的CM-GLasso框架学习可解释的视觉语言依赖图
研究人员开发了CM-GLasso,一个用于从多模态视觉语言数据中学习可解释条件依赖结构的新框架。该方法将视觉语言表示学习与稀疏高斯图模型相结合。CM-GLasso利用文本可视化策略处理类别-属性描述,并通过跨注意力蒸馏机制将高维图像块压缩成语义图节点,生成跨模态结构先验。该框架采用联合ADMM公式进行高效估计,并在各种基准测试中表现出竞争力,包括在分类和分割任务上取得高精度。
-
新的神经先验估计器从潜在表示中学习类别先验
研究人员开发了一种名为神经先验估计器(NPE)的新颖方法,可以直接从网络的潜在表示中学习类别先验,而不是依赖于显式的类别计数。该方法涉及将轻量级的先验估计模块(PEM)附加到潜在空间,并使用逻辑目标进行训练。在CIFAR-10和CIFAR-100等数据集上的实验表明,由此产生的学习到的logit校正NPE-LA,与标准方法相比具有竞争力,并能改善少数类别的性能。该技术在STARE和ADE20K数据集的密集预测任务中也被证明是一种有效的…
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
新方法增强 Spiking Transformer 在图像任务上的性能 · 跟踪 2 个来源
研究人员引入了尖峰局部交互 (SLI) 和自适应互补融合 (ACF) 来增强 Spiking Transformer。这些方法通过引入一个独立于注意力的通道,用于相邻尖峰令牌之间的直接信息交换,并自适应地平衡 SSA 和 SLI 的贡献,从而解决了标准尖峰自注意力 (SSA) 的局限性。在包括 ImageNet-1K 和 ADE20K 在内的各种数据集上的实验表明,在图像分类、基于事件的识别和语义分割方面取得了持续的改进。
-
新的SCLA-BCP方法增强了脉冲神经网络Transformer的注意力局部性
研究人员开发了一种名为空间连续局部注意力与边界连续性通路(SCLA-BCP)的新方法,以提高脉冲神经网络Transformer的空间局部性。该方法解决了在脉冲驱动的视觉处理中建立局部化token交互的挑战。SCLA-BCP在相邻token区域内计算注意力,并使用卷积通路进行跨边界通信,在COCO 2017和ADE20K等数据集上展示了显著的准确性提升,且开销极小。
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…