PASCAL-VOC
PulseAugur coverage of PASCAL-VOC — every cluster mentioning PASCAL-VOC across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新管道简化了深海图像数据用于目标检测
一个名为 mbariml 的新 Python 管道已被开发出来,用于简化从深海图像和视频创建目标检测训练数据的过程。该系统利用 Ultralytics YOLO 模型识别对象,并将检测结果存储为可供人类审查和编辑的感兴趣区域。该管道支持对相似检测进行批量接受或拒绝,并可以导入现有的 YOLO 和 PASCAL-VOC 数据集进行审查和扩展。特别关注视频数据,从中选择代表性帧进行跟踪,以避免重复标记。
-
新研究将信息密度与视觉对象检测中的偏差联系起来
研究人员提出了“信息密度”的概念,认为它可能解释视觉对象检测模型中的类别偏差,而不仅仅是数据集中实例的数量。他们观察到类别的信��密度与其准确率之间存在负相关,这表明信息密度不平衡会导致模型性能偏差。通过将这一概念纳入对象检测损失函数,在 Pascal VOC、COCO-LT 和 LVIS 等数据集上的实验显示,模型偏差减小,整体性能有所提高。
-
新的SELECT方法解决了语义分割中的灾难性遗忘问题
研究人员推出了一种新颖的类别增量语义分割(CISS)方法SELECT,旨在减轻灾难性遗忘和背景偏移。该方法通过上下文迁移注意力机制将新类学习与语义上相似的过去类联系起来,该机制聚合学习到的令牌以进行结构化初始化。为了保持表示的完整性,SELECT采用了受控噪声扰动和基于边距的损失函数。在Pascal VOC和ADE20K数据集上的实验表明,SELECT的性能优于现有方法,mIoU得分有所提高。
-
新框架在无显式背景监督下学习物体性
研究人员开发了一个名为背景无关物体性学习(B-FOR)的新框架,用于类别无关物体检测。该方法在没有显式背景监督的情况下学习物体性,解决了传统闭集训练可能导致的物体性偏差的局限性。B-FOR 预测密集的物体中心和尺度场,并使用结构化软目标将监督限制在标注区域内。在 PASCAL VOC、MS-COCO 和 Open Images 数据集上的实验表明,该方法在泛化到未见类别和跨数据集分布方面有所改进,比之前的类别无关基线高出 10 个 AR 点以上。
-
新的DASA框架通过多因素数据增强提升语义分割性能
研究人员开发了一个名为难度感知样本分配(DASA)的新框架,以改进语义分割中的数据增强。DASA结合了预测模糊性、训练损失、类别稀有度和边界复杂度等多个因素,为每个训练样本创建一个统一的难度得分。然后,该得分指导应用于该特定样本的数据增强强度。在Oxford-IIIT Pet和PASCAL VOC等数据集上,使用U-Net、DeepLabV3和SegFormer-B0等架构进行的实验表明,DASA在标准训练方法和具有竞争力的自适应基线…
-
新的DistScan框架可检测目标检测模型的后门
研究人员开发了DistScan,一个用于检测目标检测模型后门的新型框架。该方法通过分析模型在干净数据上预NMS预测类别分布的偏移来识别恶意修改,这与正常训练频率不同。DistScan无需访问模型权重或了解触发器,并且在现有技术之上表现出色,尤其是在场景级攻击方面。
-
新的AI框架CREST分割SAR影像中的极地低压
研究人员开发了一种新颖的弱监督语义分割框架CREST,用于识别Sentinel-1 SAR影像中的极地低压。该方法通过仅从图像级标签生成像素级掩码来解决像素级掩码有限的挑战。CREST包含一个约束区域扩展模块来编码空间连通性,以及一个动态引导损失来管理标签可靠性,在SAR数据和其他基准数据集上表现优于标准的对抗擦除技术。
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
DeCLIP框架增强CLIP以实现多标签增量学习
研究人员推出DeCLIP,一个新颖的框架,旨在通过解决CLIP模型的问题来改进多标签类别增量学习(MLCIL)。DeCLIP利用解耦提示来学习特定类别的正向和负向提示,这有助于匹配视觉-语言对并减少视觉表示的纠缠。这种方法旨在减轻灾难性遗忘,而无需数据重放。此外,DeCLIP还包含一种称为自适应相似度调节(Adaptive Similarity Tempering)的推理时策略,以减少部分标记场景中的误报。
-
新方法增强了对语义分割模型的对抗性攻击
研究人员开发了IGME,一种为语义分割模型生成可迁移对抗性扰动的有效方法。该方法使用单个源模型来组合攻击组件,共享梯度计算以降低成本。IGME采用集成梯度风格的路径平均方向来稳定更新,并在CNN和Transformer模型上展示了与现有方法相比具有竞争力的可迁移性和运行时效率。
-
新框架通过语义概率方法增强开放世界对象检测
研究人员开发了一个名为MSPO的新框架,通过整合语义信息和视觉对象性来改进开放世界对象检测(OWOD)。该方法利用已知类别的语言先验来更好地区分已知对象、来自未知类别的对象和背景杂波。在基准数据集上的实验表明,MSPO增强了现有OWOD模型的性能,特别是在区分已知和未知对象以及提高整体检测精度方面。
-
新的MSPO框架通过语义校准增强开放世界物体检测
研究人员开发了MSPO,一个新颖的语义校准框架,旨在改进开放世界物体检测(OWOD)。MSPO通过整合来自已知类别的语言先验来增强现有的概率物体性模型。这种方法有助于区分已知物体、来自未见类别物体和背景杂波,而无需将OWOD转换为开放词汇分类。在M-OWODB和S-OWODB数据集上的实验表明,MSPO在聚合指标上提升了性能,并在PASCAL VOC上将mAP提高了多达2.7个百分点,证明了语义校准对概率物体性的有效性。
-
新的基准和框架推动网络监督多标签图像识别
研究人员推出了一种新的网络监督多标签识别基准,该领域使用免费的网络图像来训练深度学习模型,从而减少了对昂贵手动标注的需求。该基准名为 Web-COCO 和 Web-Pascal,包含约 300,000 张图像,旨在标准化多标签识别任务的评估协议。除了基准之外,研究团队还提出了一个双分支多标签对比学习 (DBMLCL) 框架,该框架在识别和纠正噪声标签方面表现出卓越的性能。
-
新框架OKR提升领域增量目标检测性能
研究人员推出了一种名为正交知识刷新(OKR)的新型框架,旨在改进领域增量目标检测(DIOD)。OKR解决了模型在适应新数据域时不会丢失先前知识的挑战。该框架通过创建独立的、特定于域的子空间进行融合决策,从而防止干扰和性能下降。OKR还结合了基于梯度的正交刷新策略和拓扑感知一致性,以进一步最小化知识遗忘和语义碎片化。
-
新的分层槽注意力模型学习多层次语义场景分解
研究人员开发了分层槽注意力(HSA),一种新颖的语义场景分解框架,可以从单个模型中学习多粒度表示。与之前产生扁平的、基于外观的分解的方法不同,HSA在整体(前景/背景)、语义(对象类别)和全景(个体实例)级别识别层次结构。通过仅使用10%的标记数据和分层对齐损失,HSA在COCO和PASCAL VOC数据集上与扁平基线相比取得了显著的性能提升。
-
LipSSD 论文引入 Lipschitz 约束以实现鲁棒的目标检测
研究人员推出 LipSSD,一种增强目标检测系统对抗鲁棒性的新方法。通过将 Lipschitz 约束纳入架构,LipSSD 旨在创建对恶意扰动具有内在更高抵抗力的检测器。该方法提供了传统对抗性训练的设计级替代方案,在未见过的攻击上表现出改进的性能,并在 LARD 和 KITTI 等安全关键数据集上保持了干净的准确性。
-
LipSSD 模型增强了物体检测的对抗鲁棒性
研究人员开发了 LipSSD,这是一种新颖的物体检测模型,旨在增强对抗鲁棒性。通过将 Lipschitz 约束纳入其架构,LipSSD 旨在为标准检测器提供更可靠的替代方案,尤其是在安全关键应用中。该模型在很大程度上保持了其在 LARD 和 KITTI 等专业数据集上的干净性能,同时证明了其对各种对抗性攻击的鲁棒性有所提高。
-
PixCon框架通过清洁正例对比学习增强半监督分割 · 已追踪2个来源
研究人员推出了PixCon,一个新颖的半监督语义分割框架,旨在通过利用基础模型来提高准确性。PixCon采用清洁正例像素对比学习方法,并带有每类内存库,通过构建确保无污染的正例集。该方法旨在更有效地构建嵌入空间,在PASCAL-VOC、Cityscapes和ADE20K等数据集上提供优于现有基线模型的性能。
-
新的路由系统优化边缘和云之间的AI推理
研究人员开发了一种新颖的“预算自适应路由”系统,旨在优化边缘和云端计算资源之间的推理协作。该系统智能地决定是否将任务从较弱的边缘模型卸载到较强的云模型,通过直接从原始像素中提取路由信号,其性能优于现有方法。这种自适应方法根据可用的卸载预算动态地在弱模型跳过和弱模型条件放置之间进行选择,显著降低了每帧的延迟,甚至在某些操作点上以更低的计算成本超越了强模型的性能。
-
新的CL-CLIP框架利用CLIP增强持续目标检测能力
研究人员开发了CL-CLIP,一个用于持续目标检测的新框架,该框架利用CLIP的视觉语言能力。该方法旨在使目标检测器能够随着时间的推移学习新类别,而不会忘记先前获得的知识。CL-CLIP采用成本量化引导的类别解耦方法来处理视觉令牌和类别文本嵌入,从而提高了在PASCAL VOC和MS-COCO等数据集上的性能。