Mask2Former
PulseAugur coverage of Mask2Former — every cluster mentioning Mask2Former across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法提高手术器械分割精度
研究人员开发了一种拓扑感知的查询选择方法,以改进手术器械的实例分割。该方法将候选预测表示为图,学习关系表示来预测正确的实例数量并选择最优子集。在密封测试集上的评估显示,实例F1分数有所提高,集合失败率有所降低,但跨域稳定迁移仍未确立。
-
ST-LoRA: 农业分割的参数高效集成
研究人员开发了ST-LoRA,一个新颖的、参数高效的集成框架,专为不确定性感知的农业分割而设计。该方法将低秩自适应(LoRA)与快照集成相结合,从单一训练轨迹中创建多样化的集成成员,显著减少了可训练参数和计算需求。在分割精度、校准和农业数据集的分布外检测方面,ST-LoRA的性能与全秩集成和其他高效基线相当或更优。
-
LLM 通过新颖的语言注入模块增强食物图像分割
研究人员开发了两个新颖的模块 LIM-F 和 LIM-Q,通过整合源自大型语言模型 (LLM) 的食材标签来增强食物图像分割。这些模块可以添加到现有的图像编码器和解码器中,而无需预先对齐的图像-文本数据。当应用于 FoodSeg103 基准测试时,所提出的方法取得了最先进的结果,其中 LIM-Q 和 Swin-L 编码器达到了 55.0 mIoU。该方法还证明了其在基于 CNN 的架构上的有效性,并且 GPU 内存使用量仅有适度增加。
-
QueenVIS框架在无视频训练的情况下增强了视频实例分割
研究人员推出了一种名为QueenVIS的新颖框架,旨在通过关注单帧训练期间对象查询的质量来改进视频实例分割(VIS)。该方法挑战了传统上对视频级监督和昂贵身份一致性标注的依赖。QueenVIS通过用于特征和中心预测的辅助头来增强对象查询,这些辅助头在推理过程中被丢弃,不会增加计算开销。该框架利用一种无需训练的查询传播方法和一个内存库来维护时间身份,在YouTube-VIS和OVIS等基准测试中取得了显著的性能提升。
-
ESRVS方法以最小监督实现高精度视网膜血管分割
研究人员开发了ESRVS,一种新颖的视网膜血管分割方法,仅需一张标注图像和一组未标注图像。该方法利用基础模型标签传播,使用DINOv3特征和受物理启发的先验知识生成初始伪标签。ESRVS随后通过加权伪标签训练和对抗性精炼来优化监督,在多个公共数据集上取得了最先进的成果,并与全监督方法相比保持了很高的性能百分比。
-
视觉编码器集成在ICRA 2026分割挑战赛中获得第二名
研究人员为ICRA 2026 GOOSE 2D 精细语义分割挑战赛开发了一种预训练多样化的基础视觉编码器集成。他们的方法将DINOv3、SigLIP2和InternImage等编码器与Mask2Former解码器相结合,并采用了广泛的训练计划和增强技术。该集成在挑战赛中获得第二名,综合mIoU得分达到75.40%,并强调预训练配方是准确性的关键因素,而非模型大小或解码器设计。
-
新基准和挑战解决方案推动遥感和场景理解发展
研究人员推出了一项名为 Hedgementation 的新基准,用于评估机器学习模型在遥感数据中的树篱绘制能力。该基准使用来自法国的数据,评估了监督学习和自监督学习模型在不同空间距离和气候区域的泛化能力。另外,一份技术报告详细介绍了 ICRA 2026 GOOSE 2D 精细语义分割挑战赛的获胜解决方案,该方案采用了预训练多样化的基础视觉编码器集成,在户外场景理解方面取得了高精度。
-
AI模型在ICRA 2026 GOOSE 2D分割挑战赛中取得顶尖排名 · 追踪4个来源
研究人员为ICRA 2026 GOOSE 2D细粒度语义分割挑战赛开发了先进的方法,并取得了顶尖排名。一个团队利用Segment Anything Model 3 (SAM3) 结合自蒸馏技术和多尺度测试时增强,以69.73%的mIoU获得第四名。另一组利用DINOv3结合Mask2Former解码器和集成方法,以76.57%的综合得分获得第一名。第三个参赛项目GOOSE-M2F,通过调整Mask2Former并结合特定模块和训练策略…
-
机器人通过校准的基础模型数据提高地图精度
研究人员开发了一种新方法,以提高集成到机器人映射系统中的语义信息的可靠性。该方法校准基础模型声明的每类可靠性,并实施冲突丢弃窗口以拒绝与几何感知数据相矛盾的声明。在KITTI-360和ScanNet数据集上的评估表明,与现有方法相比,地图的准确性和精度有了显著提高。
-
新的D3S2方法为语义分割提炼数据集
研究人员开发了D3S2,一个专门为语义分割任务设计的、新颖的数据集提炼框架。该方法通过一个涉及平衡掩码选择和扩散引导图像合成的两阶段方法,解决了类别不平衡和精确像素对齐等挑战。D3S2通过引导扩散采样确保空间对齐并提高训练效用,即使在1%的压缩率下,也能在基准数据集上显著提高平均交并比(mIoU)分数。
-
New Vision Transformer baseline sets SOTA on material segmentation
研究人员通过建立新的 Vision Transformer 基线,重新激活了 Apple Dense Material Segmentation (DMS) 基准。他们发现,由于高方差梯度,标准训练方法在处理无定形纹理时存在困难,从而开发了一种稳定的训练方法。这种新方法在原始数据集划分上取得了 0.4572 的最先进 mIoU,超越了之前的卷积模型。然而,该研究还揭示了一个“泛化悖论”,即数据丰富的划分虽然提高了指标,但却降低了实际性…
-
AI模型实现无人机影像中树冠的精细化分割
研究人员开发了一种深度学习模型,用于利用无人机影像分割阔叶林中的单棵树冠。该模型基于Mask2Former,在来自日本七个森林的超过18,500个手动描绘的树冠多边形上进行了训练。它在包括婆罗洲热带雨林在内的不同森林类型中表现出强大的性能和泛化能力,凸显了大型、高质量标注数据集的重要性。这项技术已集成到DF Scanner Pro软件中,以辅助实际的森林监测。