instance segmentation
PulseAugur coverage of instance segmentation — every cluster mentioning instance segmentation across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的HCFormer架构使用双曲聚类实现可解释的视觉模型
研究人员开发了HCFormer,这是一种新的视觉骨干架构,它利用双曲层次聚类进行视觉表示学习。这种名为ClusterMixer的方法,为视觉Transformer等模型中发现的传统token mixer提供了一种更具可解释性的替代方案。通过在双曲空间中进行聚类以捕捉层次关系,HCFormer在各种计算机视觉任务(包括图像分类和分割)中表现出稳健的性能。
-
语义分割:计算机视觉中的像素级理解
语义分割是一种计算机视觉技术,它为图像中的每个像素分配一个特定的类别标签。这个过程使模型能够创建详细的地图,在像素级别区分道路、人或缺陷等元素,这对于自动驾驶和医学成像等应用至关重要。与分类或对象检测不同,语义分割通过分析每个单独的像素来提供更精细级别的理解。
-
DA-Fusion Transformer 提升未见物体分割能力,助力物流业
研究人员开发了DA-Fusion,一种新颖的Transformer模型,它利用可变形注意力来融合RGB和深度数据,以改进未见过的物体实例分割。这项进展对于物流自动化任务(如箱式抓取和货架式抓取)尤其有益,因为在这些任务中,在混乱环境中精确识别物体至关重要。该团队还引入了物体混乱箱数据集(Object Clutter Bin Dataset, OCBD)来评估这些场景下的性能基准,证明了DA-Fusion在准确性方面优于现有方法。
-
多目标跟踪:赋予AI系统超越目标检测的记忆能力
多目标跟踪(MOT)是目标检测的一项进步,它为视频流中识别出的对象提供了身份、记忆和历史背景。这对于自动驾驶和零售分析等应用至关重要,在这些应用中,理解场景如何随时间演变至关重要。与将每一帧独立处理并存在闪烁和对象“遗忘”问题的纯目标检测不同,MOT通过赋予计算机记忆能力,实现了更智能的系统。
-
新的共形预测算法增强了实例分割中的不确定性量化
研究人员开发了一种新的共形预测算法,用于为实例分割任务生成自适应置信集。该方法解决了当前模型中缺乏原则性不确定性量化的问题,为预测准确性提供了可证明的保证。该算法已应用于农业田地划界、细胞分割和车辆检测,通过根据查询难度改变预测集大小并实现目标覆盖率,展示了优于现有方法的实证改进。
-
PotatoGANs 利用合成数据和 XAI 增强病害识别
研究人员开发了一种名为 PotatoGANs 的新型数据增强技术,以改进马铃薯病害的识别和分类。该方法利用生成对抗网络 (GANs) 创建患病马铃薯的合成图像,从而扩展数据集并提高模型泛化能力,这是传统增强方法难以实现的。研究发现,与 Pix2Pix 相比,CycleGAN 生成的合成图像质量更高,Inception Score 评分也证明了这一点。此外,该研究将可解释人工智能 (XAI) 算法与各种卷积神经网络 (CNN) 架构相结…
-
新的蒸馏方法增强了车辆碰撞规避AI性能
研究人员开发了一种实例感知知识蒸馏框架,以改进碰撞规避系统的半监督学习。该方法通过结合教师模型的领域先验知识和基础模型的实例中心知识来生成伪标签,旨在降低边缘部署的标注成本和计算需求。由此产生的轻量级学生模型可以实时执行多种密集预测任务,例如实例分割和单目深度估计,在分割方面优于较大的教师模型,同时保持深度估计的性能。该系统已在乡村俱乐部环境中使用自定义数据集和低成本边缘设备进行了验证。
-
新的RBDC协议将视觉模型训练成本降低了30%
研究人员开发了一种名为RBDC的新训练协议,以提高训练大型视觉模型的可资源效率。该方法通过无参数的块对角线方式递归地耦合独立训练的、更窄的模型。在ImageNet上使用Vision Transformers和ResNets进行的评估表明,与现有的增长方法相比,FLOPs减少了30%,准确率相当,并且在相同的训练FLOPs下性能有所提高。RBDC训练的模型在作为对象检测和实例分割等下游任务的骨干网络方面也显示出增强的效用。