SegFormer
PulseAugur coverage of SegFormer — every cluster mentioning SegFormer across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
FCBNet 在航空影像中提供参数高效的杂草检测
研究人员开发了 FCBNet,这是一种参数高效的卷积神经网络,用于检测多光谱航空影像中的伪装杂草。该模型采用冻结的 ConvNeXt 主干和新颖的特征校正块 (FCB) 进行高效特征精炼,并结合轻量级解码器。FCBNet 在 WeedBananaCOD 和 WeedMap 数据集上表现出卓越的性能,mIoU 超过 85%,并且优于 U-Net 和 SegFormer 等模型,由于其参数高效的设计,所需的训练时间和内存显著减少。
-
新的MeCSAFNet架构改进了多光谱土地覆盖分割
研究人员推出了一种新颖的多编码器架构MeCSAFNet,专为多光谱图像的语义分割(特别是土地覆盖分类)而设计。该网络利用双ConvNeXt编码器独立处理可见光和非可见光光谱通道,然后融合它们的特征。该融合过程通过注意力机制和专门的激活函数得到增强,以确保稳定的优化。在基准数据集上的实验表明,与U-Net和SegFormer等现有模型相比,MeCSAFNet在平均交并比(mIoU)方面取得了显著的改进,其紧凑型变体为资源受限的应用提供了效率。
-
新的证据深度学习方法改进了分割中的OOD检测
研究人员开发了一种新颖的方法,通过在证据深度学习(EDL)框架中利用基于Wasserstein的目标来改进语义分割网络中的分布外(OOD)检测。该方法旨在通过更可靠地识别不熟悉的对象来提高自动驾驶等关键应用的安全性。研究探讨了不同Wasserstein阶数对分割准确性和OOD检测的影响,发现最佳阶数取决于网络架构,并且仅需一次前向传播即可超越现有基线。
-
新研究将AI视觉模型与人类物理推理进行比较
研究人员开发了一种新方法,用于比较计算机视觉模型学习到的物体表征与人类的物体表征。通过对178名和50名人类参与者分别进行碰撞时间和变化检测任务,他们发现经过中等时长训练的模型更能匹配类似人类的粗略、体积物体表征。更大的模型更早实现了这种对齐,表明这些表征在通用视觉模型中资源受限的情况下出现。这项工作建立了一个将视觉模型与人类认知对齐的框架,并突显了当前AI能力与人类理解之间日益扩大的差距。
-
GazeDiT 扩散模型生成精确的眼动追踪训练数据
研究人员开发了 GazeDiT,这是一种新颖的扩散模型,旨在为眼动追踪训练数据生成高度精确的合成图像。该模型通过内部构建一个空间条件来解决扩散模型中精确标签控制的挑战,该条件将全局注视标签固定在局部瞳孔和虹膜几何形状上。通过利用冻结的 SegFormer 提取几何特征和物理眼部渲染器生成多样化的注视一致几何形状,GazeDiT 与其他扩散基线相比显著降低了注视标签误差,并提高了下游眼动追踪器的性能。
-
新的JEDI框架蒸馏大型视觉模型以实现高效的卫星图像分割
研究人员开发了JEDI(JEPA-to-Edge Distillation),一个新颖的两阶段框架,旨在高效地将大型视觉模型的知识转移到更小、更易于部署的模型中,用于卫星图像分割。该方法对大型I-JEPA Vision Transformer教师模型和紧凑型SegFormer学生模型之间的表示进行对齐,从而在保持高性能的同时实现显著压缩。在CalCROP21数据集上,JEDI仅用404万个参数就达到了68.0的平均交并比(mIoU),…
-
DWFF-Net 推进多尺度分割在农业栖息地测绘中的应用
研究人员开发了 DWFF-Net,一种用于农业栖息地识别中多尺度分割的新方法。该网络利用冻结的 DINOv3 编码器进行特征提取,并采用一种自适应动态加权策略,该策略根据图像类别关系和场景复杂度进行调整。然后,解码器使用动态权重计算网络和混合损失函数融合多级特征。实验表明,DWFF-Net 在分割精度上显著优于 U-Net 和 SegFormer 等现有模型,尤其是在小特征方面,从而能够实现更精确的栖息地测绘和监测。
-
新方法改进使用Landsat-8影像的火灾分割
研究人员开发了一种使用Landsat-8卫星影像分割主动火灾的新方法,解决了火灾像素数据稀疏和不平衡的挑战。该研究评估了三种分割架构——U-Net、DeepLabV3+和SegFormer——并发现U-Net在各种火灾大小和密度下表现出最强的鲁棒性。短波红外2(SWIR2)光谱波段持续产生最佳或接近最佳的结果,凸显了其在主动火灾检测中的重要性。
-
研究发现:无人机野火分割受益于RGB-红外融合
研究人员对使用无人机(UAV)进行野火分割的多模态RGB-红外融合进行了比较研究。该研究评估了U-Net、DeepLabV3+和SegFormer架构的三种融合策略,分析了每种模态的贡献以及融合时机的影响。研究结果表明,热红外信息对于基于无人机的野火分割至关重要,基于Transformer的网络进行特征级融合在未来发展中显示出最大的潜力。
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
StaticSegFormer 提升语义分割效率且不损失性能
研究人员开发了 StaticSegFormer,这是一种新颖的静态结构化剪枝方法,旨在提高深度神经网络在语义分割任务中的效率。该方法专门针对 SegFormer 网络中的注意力层,目标是在不牺牲性能(mIoU)的情况下降低计算复杂度(FLOPs)并提高帧率(fps)。在 ADE20K 和 Cityscapes 基准测试上的实验表明,在 Cityscapes 上 fps 显著提高了高达 34%,而 mIoU 没有下降,尤其有利于较小的编…
-
ST-LoRA: 农业分割的参数高效集成
研究人员开发了ST-LoRA,一个新颖的、参数高效的集成框架,专为不确定性感知的农业分割而设计。该方法将低秩自适应(LoRA)与快照集成相结合,从单一训练轨迹中创建多样化的集成成员,显著减少了可训练参数和计算需求。在分割精度、校准和农业数据集的分布外检测方面,ST-LoRA的性能与全秩集成和其他高效基线相当或更优。
-
Med-SegLens框架增强了医学图像分割模型的可解释性
研究人员开发了Med-SegLens,一个旨在提高医学图像分割模型可解释性的框架。该系统使用稀疏自编码器将模型激活分解为可理解的潜在特征,从而能够诊断分割失败并缓解数据集偏移。通过对不同架构和数据集的潜在表示进行对齐,Med-SegLens识别出驱动错误的共享特征和特定于人群的特征。该框架证明了这些潜在特征是分割失败的因果瓶颈,并且在此级别进行干预可以在无需完全重新训练的情况下纠正错误并改进跨数据集适应性,显著提高了失败案例的Dice分数。
-
New framework enhances plant stress phenotyping with diffusion-guided segmentation
研究人员开发了一种新颖的扩散引导混合分割框架,旨在提高农业图像中植物胁迫表型分析的准确性和效率。该框架将 U-Net、DeepLabV3+ 和 SegFormer 等成熟的分割模型与去噪扩散概率模型 (DDPM) 相结合,以优化分割掩码。该系统即使在标注有限的情况下也表现出强大的性能,并且对灰度转换、雾和阴影等各种外观扰动具有鲁棒性。此外,适应的模型对外部农业数据集表现出有效的可迁移性,表明扩散优化和边界感知优化对于实际应用具有价值。
-
SalFormer360:基于Transformer的模型增强了360度视频的显著性估计
研究人员开发了SalFormer360,这是一种用于360度视频的新型显著性估计模型,它采用了基于Transformer的架构。该模型结合了SegFormer编码器和自定义解码器,并纳入了观看中心偏差,以更好地反映沉浸式环境中的用户注意力。在三个大型基准数据集上的实验表明,SalFormer360的性能显著优于现有的最先进方法,在Sport360、PVS-HM和VR-EyeTracking等数据集上实现了Pearson相关系数的显著提升。
-
AI框架精准量化作物病害严重程度
研究人员开发了一种新颖的深度学习框架,用于精准量化田间作物的病害严重程度,旨在改进精准农业。该系统集成了语义分割、回归和分类,以评估压力水平,并根据受感染的叶片面积将其分为低到非常高。实验表明,使用MobileNetV2的U-Net模型取得了高性能,像素准确率为98.20%,严重程度指数与专家标注高度相关。
-
新框架通过迁移学习增强焊接机器人接缝分割 · 跟踪 2 个来源
研究人员开发了一个新框架,以改进建筑自动化焊接机器人的接缝分割,解决了恶劣光照和反射等挑战。该方法利用迁移学习和混合损失函数增强了 BiSeNetV2 模型,侧重于学习稳定性优化而非架构复杂性。该方法显著提高了性能,在反射条件下实现了 81.76% 的联合 IoU,并恢复了 96.33% 的失败案例,同时保持了实时应用的效率。
-
视觉基础化通过语义分割增强机器人导航
研究人员开发了一种新颖的方法,通过结合视觉基础化来改进使用视觉-语言-动作 (VLA) 模型的机器人导航。该技术利用语义分割将可通行区域标记为绿色,不可通行区域标记为红色,从而有效地指导机器人的路径。当在 Grand Tour 数据集上使用 OmniVLA 模型进行测试时,这种视觉基础化方法将长指令的平均航点误差降低了高达 44%,充当了轨迹长度正则化器,而无需重新训练模型。
-
新的视觉基础方法提高了机器人导航的准确性
研究人员开发了一种新的方法,通过使用视觉基础来改进机器人导航,该方法利用了视觉-语言-动作(VLA)模型。该技术使用语义分割将可通行区域标记为绿色,不可通行区域标记为红色,从而有效地指导机器人。当在 Grand Tour 数据集上使用 OmniVLA 模型进行测试时,这种视觉基础方法将平均航点误差降低了高达 44%,尤其是在较长指令的情况下,并充当了轨迹长度正则化器。
-
DualGate-Net 通过自适应先验改进组织病理学细胞检测
研究人员开发了 DualGate-Net,一种用于检测组织病理学图像中细胞的新型框架。该系统采用双编码器方法,结合局部和全局编码器以及可学习的先验门控融合机制,以自适应地整合组织上下文。在 OCELOT 基准上的实验显示性能有所提高,在验证集上的宏 F1 分数为 0.7722,在测试集上的宏 F1 分数为 0.7345。