ADE20K
PulseAugur coverage of ADE20K — every cluster mentioning ADE20K across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
新的神经先验估计器从潜在表示中学习类别先验
研究人员开发了一种名为神经先验估计器(NPE)的新颖方法,可以直接从网络的潜在表示中学习类别先验,而不是依赖于显式的类别计数。该方法涉及将轻量级的先验估计模块(PEM)附加到潜在空间,并使用逻辑目标进行训练。在CIFAR-10和CIFAR-100等数据集上的实验表明,由此产生的学习到的logit校正NPE-LA,与标准方法相比具有竞争力,并能改善少数类别的性能。该技术在STARE和ADE20K数据集的密集预测任务中也被证明是一种有效的…
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
新方法增强 Spiking Transformer 在图像任务上的性能 · 跟踪 2 个来源
研究人员引入了尖峰局部交互 (SLI) 和自适应互补融合 (ACF) 来增强 Spiking Transformer。这些方法通过引入一个独立于注意力的通道,用于相邻尖峰令牌之间的直接信息交换,并自适应地平衡 SSA 和 SLI 的贡献,从而解决了标准尖峰自注意力 (SSA) 的局限性。在包括 ImageNet-1K 和 ADE20K 在内的各种数据集上的实验表明,在图像分类、基于事件的识别和语义分割方面取得了持续的改进。
-
新的SCLA-BCP方法增强了脉冲神经网络Transformer的注意力局部性
研究人员开发了一种名为空间连续局部注意力与边界连续性通路(SCLA-BCP)的新方法,以提高脉冲神经网络Transformer的空间局部性。该方法解决了在脉冲驱动的视觉处理中建立局部化token交互的挑战。SCLA-BCP在相邻token区域内计算注意力,并使用卷积通路进行跨边界通信,在COCO 2017和ADE20K等数据集上展示了显著的准确性提升,且开销极小。
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…
-
新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源
研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。
-
DSeq-JEPA架构通过顺序预测增强视觉表示学习
研究人员推出了一种新颖的自监督视觉表示学习架构DSeq-JEPA。该模型在基于图像的联合嵌入预测架构(I-JEPA)的基础上,通过引入判别式顺序预测过程。DSeq-JEPA首先关注重要的视觉区域,然后逐步预测后续区域,模仿人类的注意力。在图像分类和目标检测等多个基准测试中的实验表明,DSeq-JEPA比其前身学习到更鲁棒、更具泛化性的表示。
-
StaticSegFormer 提升语义分割效率且不损失性能
研究人员开发了 StaticSegFormer,这是一种新颖的静态结构化剪枝方法,旨在提高深度神经网络在语义分割任务中的效率。该方法专门针对 SegFormer 网络中的注意力层,目标是在不牺牲性能(mIoU)的情况下降低计算复杂度(FLOPs)并提高帧率(fps)。在 ADE20K 和 Cityscapes 基准测试上的实验表明,在 Cityscapes 上 fps 显著提高了高达 34%,而 mIoU 没有下降,尤其有利于较小的编…
-
新的 iFAN 框架提高了掩码 Transformer 的图像分割精度
研究人员开发了一个名为推理感知学习 (iFAN) 的新训练框架,旨在提高用于图像分割的普通掩码 Transformer 的性能。iFAN 解决了两个关键问题:高概率分数与实际掩码质量之间的不匹配,以及中间层可能丢失的优越预测。通过结合调整概率-掩码排序 (APMR) 和跨层自蒸馏 (CLSD),iFAN 在各种数据集和架构上提高了分割精度,同时对计算资源的影响最小。
-
新 Bootleg 方法增强了 AI 模型自监督学习能力
研究人员开发了一种名为 Bootleg 的新自监督学习方法,旨在结合生成方法的稳定性和预测方法的效率。Bootleg 训练模型从教师模型的多个隐藏层预测潜在表示,使其能够同时捕获不同抽象级别的特征。在分类和语义分割的多个基准数据集上,这种方法显示出比 I-JEPA 等现有方法显著的改进。
-
新型视觉SSM消除方向扫描,提升图像识别能力
研究人员推出了一种新颖的二阶非因果状态空间模型(SSM),名为Vision Non-Causal Trapezoidal Mamba (VNCT),专为视觉识别任务设计。与依赖方向性标记扫描的先前视觉SSM不同,VNCT在单次传递中同时处理所有图像标记,消除了方向偏差并降低了推理延迟。这种方法产生了更具方向鲁棒性的表示,从而在ImageNet-1K分类、COCO目标检测和ADE20K语义分割等基准测试中取得了更好的性能,尤其是在需要精…
-
新的深度剪枝方法提高了视觉Transformer的效率
研究人员开发了一种名为HetDPT的新方法来改进视觉Transformer(ViTs)的深度剪枝。该方法考虑了不同层之间的异构性,而这是先前深度剪枝技术的局限性。HetDPT避免了维度不匹配的问题,并在ImageNet-1K和CIFAR-100等数据集上实现了显著的加速,同时保持了准确性。当与宽度剪枝结合时,HetDPT+在极端的ViT剪枝方面设定了新的最先进水平,在接近无损准确率的情况下实现了更高的加速比。
-
PixCon框架通过清洁正例对比学习增强半监督分割 · 已追踪2个来源
研究人员推出了PixCon,一个新颖的半监督语义分割框架,旨在通过利用基础模型来提高准确性。PixCon采用清洁正例像素对比学习方法,并带有每类内存库,通过构建确保无污染的正例集。该方法旨在更有效地构建嵌入空间,在PASCAL-VOC、Cityscapes和ADE20K等数据集上提供优于现有基线模型的性能。
-
面向对象的LeJEPA利用SAM改进图像表示学习
研究人员开发了LeJEPA的面向对象版本,这是一种用于图像编码器的自监督学习方法。通过利用SAM生成的对象掩码,这种新方法旨在提高数据效率,优于传统的图像级方法。面向对象的LeJEPA在各种下游任务中表现出卓越的性能,包括跟踪、分类、分割和重新识别,即使在缩减的数据集上进行训练也是如此。
-
ViT 分割方法在高压缩下的对比研究
一篇新的研究论文探讨了在极高压缩率和损坏输入数据下,使 Vision Transformers (ViTs) 在语义分割任务中更高效的方法。该研究比较了两种主要方法:结构化剪枝,即移除 ViT 架构内的冗余组件;以及 Token 缩减,即减少输入 Token 的数量。研究结果表明,虽然 Token 缩减在较低压缩水平下有效,但在严重压缩下性能会显著下降,而结构化剪枝则表现出更稳定的性能曲线。该研究提出了一种结合适度剪枝和 Token …
-
新的WBMM技术提高了大卷积核的效率
研究人员开发了一种名为窗口化批处理矩阵乘法(WBMM)的新技术,以提高大卷积核深度卷积的效率。传统方法随着卷积核尺寸的增加而出现性能下降,但WBMM将输入分割成窗口并使用偏置表构建权重矩阵,通过批处理矩阵乘法实现规则的内存访问。该方法在更大的窗口下显示出更高的吞吐量,并在ImageNet-1K、COCO和ADE20K等基准测试中取得了相当或更好的准确率,同时在各种硬件平台上实现了显著的训练加速。
-
新的LUMA适配器可对图像分割骨干网络进行公平的基准测试
研究人员推出了一种新的轻量级通用掩码适配器LUMA,旨在标准化图像分割Transformer骨干网络的基准测试。该适配器充当一种与骨干网络无关的头部,通过将任何骨干网络视为黑盒特征提取器来实现公平比较。使用LUMA进行的实验表明,预训练目标(而非架构)是分割质量的主要驱动因素,并且传统的“高效”令牌混合器在高分辨率下并未提供效率优势。
-
新的训练方法消除了 Vision Transformers 中的位置嵌入
研究人员开发了一种名为 Active Spatial Guidance (Guidance) 的新训练技术,消除了 Vision Transformers (ViTs) 中对显式位置嵌入的需求。通过在训练期间对最后一层 patch token 应用辅助的二维坐标回归损失,Guidance 直接从数据中诱导空间组织。该方法在 ImageNet-100 分类和 ADE20K 语义分割等任务上持续提高了性能,优于传统的注入式位置机制,如学习…
-
Reload-Mamba 通过新颖的状态空间建模增强语义分割
研究人员开发了 Reload-Mamba,这是一个利用 Mamba 类状态空间模型来增强多类别语义分割的新颖框架。该方法通过引入边界监督局部细节先验、类别不确定性感知重载门(Reload Gate)以及分层多级别重载机制(hierarchical multi-level Reload mechanism),解决了序列传播中的响应稀释问题。这些创新共同提高了模型恢复关键边界和细节敏感响应的能力,在 ADE20K 和 Cityscapes…