SegFormer
PulseAugur coverage of SegFormer — every cluster mentioning SegFormer across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
StaticSegFormer 提升语义分割效率且不损失性能
研究人员开发了 StaticSegFormer,这是一种新颖的静态结构化剪枝方法,旨在提高深度神经网络在语义分割任务中的效率。该方法专门针对 SegFormer 网络中的注意力层,目标是在不牺牲性能(mIoU)的情况下降低计算复杂度(FLOPs)并提高帧率(fps)。在 ADE20K 和 Cityscapes 基准测试上的实验表明,在 Cityscapes 上 fps 显著提高了高达 34%,而 mIoU 没有下降,尤其有利于较小的编…
-
ST-LoRA: 农业分割的参数高效集成
研究人员开发了ST-LoRA,一个新颖的、参数高效的集成框架,专为不确定性感知的农业分割而设计。该方法将低秩自适应(LoRA)与快照集成相结合,从单一训练轨迹中创建多样化的集成成员,显著减少了可训练参数和计算需求。在分割精度、校准和农业数据集的分布外检测方面,ST-LoRA的性能与全秩集成和其他高效基线相当或更优。
-
Med-SegLens框架增强了医学图像分割模型的可解释性
研究人员开发了Med-SegLens,一个旨在提高医学图像分割模型可解释性的框架。该系统使用稀疏自编码器将模型激活分解为可理解的潜在特征,从而能够诊断分割失败并缓解数据集偏移。通过对不同架构和数据集的潜在表示进行对齐,Med-SegLens识别出驱动错误的共享特征和特定于人群的特征。该框架证明了这些潜在特征是分割失败的因果瓶颈,并且在此级别进行干预可以在无需完全重新训练的情况下纠正错误并改进跨数据集适应性,显著提高了失败案例的Dice分数。
-
New framework enhances plant stress phenotyping with diffusion-guided segmentation
研究人员开发了一种新颖的扩散引导混合分割框架,旨在提高农业图像中植物胁迫表型分析的准确性和效率。该框架将 U-Net、DeepLabV3+ 和 SegFormer 等成熟的分割模型与去噪扩散概率模型 (DDPM) 相结合,以优化分割掩码。该系统即使在标注有限的情况下也表现出强大的性能,并且对灰度转换、雾和阴影等各种外观扰动具有鲁棒性。此外,适应的模型对外部农业数据集表现出有效的可迁移性,表明扩散优化和边界感知优化对于实际应用具有价值。
-
SalFormer360:基于Transformer的模型增强了360度视频的显著性估计
研究人员开发了SalFormer360,这是一种用于360度视频的新型显著性估计模型,它采用了基于Transformer的架构。该模型结合了SegFormer编码器和自定义解码器,并纳入了观看中心偏差,以更好地反映沉浸式环境中的用户注意力。在三个大型基准数据集上的实验表明,SalFormer360的性能显著优于现有的最先进方法,在Sport360、PVS-HM和VR-EyeTracking等数据集上实现了Pearson相关系数的显著提升。
-
AI框架精准量化作物病害严重程度
研究人员开发了一种新颖的深度学习框架,用于精准量化田间作物的病害严重程度,旨在改进精准农业。该系统集成了语义分割、回归和分类,以评估压力水平,并根据受感染的叶片面积将其分为低到非常高。实验表明,使用MobileNetV2的U-Net模型取得了高性能,像素准确率为98.20%,严重程度指数与专家标注高度相关。
-
新框架通过迁移学习增强焊接机器人接缝分割 · 跟踪 2 个来源
研究人员开发了一个新框架,以改进建筑自动化焊接机器人的接缝分割,解决了恶劣光照和反射等挑战。该方法利用迁移学习和混合损失函数增强了 BiSeNetV2 模型,侧重于学习稳定性优化而非架构复杂性。该方法显著提高了性能,在反射条件下实现了 81.76% 的联合 IoU,并恢复了 96.33% 的失败案例,同时保持了实时应用的效率。
-
视觉基础化通过语义分割增强机器人导航
研究人员开发了一种新颖的方法,通过结合视觉基础化来改进使用视觉-语言-动作 (VLA) 模型的机器人导航。该技术利用语义分割将可通行区域标记为绿色,不可通行区域标记为红色,从而有效地指导机器人的路径。当在 Grand Tour 数据集上使用 OmniVLA 模型进行测试时,这种视觉基础化方法将长指令的平均航点误差降低了高达 44%,充当了轨迹长度正则化器,而无需重新训练模型。
-
新的视觉基础方法提高了机器人导航的准确性
研究人员开发了一种新的方法,通过使用视觉基础来改进机器人导航,该方法利用了视觉-语言-动作(VLA)模型。该技术使用语义分割将可通行区域标记为绿色,不可通行区域标记为红色,从而有效地指导机器人。当在 Grand Tour 数据集上使用 OmniVLA 模型进行测试时,这种视觉基础方法将平均航点误差降低了高达 44%,尤其是在较长指令的情况下,并充当了轨迹长度正则化器。
-
DualGate-Net 通过自适应先验改进组织病理学细胞检测
研究人员开发了 DualGate-Net,一种用于检测组织病理学图像中细胞的新型框架。该系统采用双编码器方法,结合局部和全局编码器以及可学习的先验门控融合机制,以自适应地整合组织上下文。在 OCELOT 基准上的实验显示性能有所提高,在验证集上的宏 F1 分数为 0.7722,在测试集上的宏 F1 分数为 0.7345。
-
GMBFormer 通过 NDVI 引导的记忆库改进城市绿地提取
研究人员开发了 GMBFormer,这是一个新的基于 Transformer 的框架,旨在改进从超高分辨率图像中提取城市绿地。该模型利用归一化植被指数 (NDVI) 数据作为物理信息门,选择性地将植被描述符纳入全局记忆库。通过采用记忆介导的交叉注意力进行原型检索,GMBFormer 旨在克服传统逐块分析的局限性,并改进空间分离区域之间的语义重用。
-
深度学习框架在水稻病害测绘中的比较
研究人员比较了各种深度学习框架,使用无人机多光谱成像来测绘水稻病害的严重程度。该研究评估了 U-Net、U-Net++、DeepLabV3+ 和 SegFormer 等架构,并使用包括植被指数在内的不同输入配置对它们进行了测试。结果显示,U-Net++ 结合 EfficientNet-B3 表现出最高的性能,mIoU 达到 97.62%,这表明轻量级卷积神经网络 (CNN) 在操作性病害监测方面更可靠。
-
New Vision Transformer baseline sets SOTA on material segmentation
研究人员通过建立新的 Vision Transformer 基线,重新激活了 Apple Dense Material Segmentation (DMS) 基准。他们发现,由于高方差梯度,标准训练方法在处理无定形纹理时存在困难,从而开发了一种稳定的训练方法。这种新方法在原始数据集划分上取得了 0.4572 的最先进 mIoU,超越了之前的卷积模型。然而,该研究还揭示了一个“泛化悖论”,即数据丰富的划分虽然提高了指标,但却降低了实际性…
-
CryoNet 使用深度学习进行高级冰川测绘
研究人员开发了 CryoNet,一个旨在利用多模态数据测绘碎屑覆盖冰川的深度学习框架。该框架整合了卫星图像、地形数据、光谱指数和雷达信息,以区分裸冰冰川、碎屑覆盖冰川和冰川湖。CryoNet 取得了很高的性能指标,包括 90.52% 的总体 IoU,在复杂山区环境中优于现有的最先进模型。
-
EDGER 框架可跨分辨率精确检测图像伪造
研究人员开发了 EDGER,一个新颖的图像伪造定位框架,可以处理任何分辨率的图像。该系统采用双分支方法,一个分支专注于边缘检测以突出操纵边界处的不一致性,另一个分支使用 CLIP-ViT 来识别合成斑块。这种组合使 EDGER 能够精确地定位被操纵的区域,并在不同数据集和图像类型上实现良好的泛化。