PASCAL-VOC
PulseAugur coverage of PASCAL-VOC — every cluster mentioning PASCAL-VOC across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的DistScan框架可检测目标检测模型的后门
研究人员开发了DistScan,一个用于检测目标检测模型后门的新型框架。该方法通过分析模型在干净数据上预NMS预测类别分布的偏移来识别恶意修改,这与正常训练频率不同。DistScan无需访问模型权重或了解触发器,并且在现有技术之上表现出色,尤其是在场景级攻击方面。
-
新的AI框架CREST分割SAR影像中的极地低压
研究人员开发了一种新颖的弱监督语义分割框架CREST,用于识别Sentinel-1 SAR影像中的极地低压。该方法通过仅从图像级标签生成像素级掩码来解决像素级掩码有限的挑战。CREST包含一个约束区域扩展模块来编码空间连通性,以及一个动态引导损失来管理标签可靠性,在SAR数据和其他基准数据集上表现优于标准的对抗擦除技术。
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
DeCLIP框架增强CLIP以实现多标签增量学习
研究人员推出DeCLIP,一个新颖的框架,旨在通过解决CLIP模型的问题来改进多标签类别增量学习(MLCIL)。DeCLIP利用解耦提示来学习特定类别的正向和负向提示,这有助于匹配视觉-语言对并减少视觉表示的纠缠。这种方法旨在减轻灾难性遗忘,而无需数据重放。此外,DeCLIP还包含一种称为自适应相似度调节(Adaptive Similarity Tempering)的推理时策略,以减少部分标记场景中的误报。
-
新方法增强了对语义分割模型的对抗性攻击
研究人员开发了IGME,一种为语义分割模型生成可迁移对抗性扰动的有效方法。该方法使用单个源模型来组合攻击组件,共享梯度计算以降低成本。IGME采用集成梯度风格的路径平均方向来稳定更新,并在CNN和Transformer模型上展示了与现有方法相比具有竞争力的可迁移性和运行时效率。
-
新框架通过语义概率方法增强开放世界对象检测
研究人员开发了一个名为MSPO的新框架,通过整合语义信息和视觉对象性来改进开放世界对象检测(OWOD)。该方法利用已知类别的语言先验来更好地区分已知对象、来自未知类别的对象和背景杂波。在基准数据集上的实验表明,MSPO增强了现有OWOD模型的性能,特别是在区分已知和未知对象以及提高整体检测精度方面。
-
新的MSPO框架通过语义校准增强开放世界物体检测
研究人员开发了MSPO,一个新颖的语义校准框架,旨在改进开放世界物体检测(OWOD)。MSPO通过整合来自已知类别的语言先验来增强现有的概率物体性模型。这种方法有助于区分已知物体、来自未见类别物体和背景杂波,而无需将OWOD转换为开放词汇分类。在M-OWODB和S-OWODB数据集上的实验表明,MSPO在聚合指标上提升了性能,并在PASCAL VOC上将mAP提高了多达2.7个百分点,证明了语义校准对概率物体性的有效性。
-
新的基准和框架推动网络监督多标签图像识别
研究人员推出了一种新的网络监督多标签识别基准,该领域使用免费的网络图像来训练深度学习模型,从而减少了对昂贵手动标注的需求。该基准名为 Web-COCO 和 Web-Pascal,包含约 300,000 张图像,旨在标准化多标签识别任务的评估协议。除了基准之外,研究团队还提出了一个双分支多标签对比学习 (DBMLCL) 框架,该框架在识别和纠正噪声标签方面表现出卓越的性能。
-
新框架OKR提升领域增量目标检测性能
研究人员推出了一种名为正交知识刷新(OKR)的新型框架,旨在改进领域增量目标检测(DIOD)。OKR解决了模型在适应新数据域时不会丢失先前知识的挑战。该框架通过创建独立的、特定于域的子空间进行融合决策,从而防止干扰和性能下降。OKR还结合了基于梯度的正交刷新策略和拓扑感知一致性,以进一步最小化知识遗忘和语义碎片化。
-
新的分层槽注意力模型学习多层次语义场景分解
研究人员开发了分层槽注意力(HSA),一种新颖的语义场景分解框架,可以从单个模型中学习多粒度表示。与之前产生扁平的、基于外观的分解的方法不同,HSA在整体(前景/背景)、语义(对象类别)和全景(个体实例)级别识别层次结构。通过仅使用10%的标记数据和分层对齐损失,HSA在COCO和PASCAL VOC数据集上与扁平基线相比取得了显著的性能提升。
-
LipSSD 论文引入 Lipschitz 约束以实现鲁棒的目标检测
研究人员推出 LipSSD,一种增强目标检测系统对抗鲁棒性的新方法。通过将 Lipschitz 约束纳入架构,LipSSD 旨在创建对恶意扰动具有内在更高抵抗力的检测器。该方法提供了传统对抗性训练的设计级替代方案,在未见过的攻击上表现出改进的性能,并在 LARD 和 KITTI 等安全关键数据集上保持了干净的准确性。
-
LipSSD 模型增强了物体检测的对抗鲁棒性
研究人员开发了 LipSSD,这是一种新颖的物体检测模型,旨在增强对抗鲁棒性。通过将 Lipschitz 约束纳入其架构,LipSSD 旨在为标准检测器提供更可靠的替代方案,尤其是在安全关键应用中。该模型在很大程度上保持了其在 LARD 和 KITTI 等专业数据集上的干净性能,同时证明了其对各种对抗性攻击的鲁棒性有所提高。
-
PixCon框架通过清洁正例对比学习增强半监督分割 · 已追踪2个来源
研究人员推出了PixCon,一个新颖的半监督语义分割框架,旨在通过利用基础模型来提高准确性。PixCon采用清洁正例像素对比学习方法,并带有每类内存库,通过构建确保无污染的正例集。该方法旨在更有效地构建嵌入空间,在PASCAL-VOC、Cityscapes和ADE20K等数据集上提供优于现有基线模型的性能。
-
新的路由系统优化边缘和云之间的AI推理
研究人员开发了一种新颖的“预算自适应路由”系统,旨在优化边缘和云端计算资源之间的推理协作。该系统智能地决定是否将任务从较弱的边缘模型卸载到较强的云模型,通过直接从原始像素中提取路由信号,其性能优于现有方法。这种自适应方法根据可用的卸载预算动态地在弱模型跳过和弱模型条件放置之间进行选择,显著降低了每帧的延迟,甚至在某些操作点上以更低的计算成本超越了强模型的性能。
-
新的CL-CLIP框架利用CLIP增强持续目标检测能力
研究人员开发了CL-CLIP,一个用于持续目标检测的新框架,该框架利用CLIP的视觉语言能力。该方法旨在使目标检测器能够随着时间的推移学习新类别,而不会忘记先前获得的知识。CL-CLIP采用成本量化引导的类别解耦方法来处理视觉令牌和类别文本嵌入,从而提高了在PASCAL VOC和MS-COCO等数据集上的性能。
-
新框架模拟光照变化以改进视觉表示学习
研究人员开发了一个新的表示学习框架,该框架明确地模拟光照变化,而不是将其视为噪声。该方法通过增加一个捕获与光照相关的视觉结构的客观目标来扩展对比学习。与标准的对比学习基线相比,该方法在图像分类和目标检测任务中表现出改进的性能。
-
新的MoEIoU损失提高了物体检测精度
研究人员开发了MoEIoU,一种利用专家混合方法的新型物体检测边界框回归损失函数。该方法自适应地结合了重叠度、中心对齐和宽高比不匹配,并采用基于课程的学习加权计划,在不同的训练阶段优先考虑不同类型的误差。MoEIoU在多个数据集和YOLO架构上展示了改进的收敛性和定位精度,优于现有的最先进损失函数。
-
新的 DANCE 方法改进了弱监督目标检测
研究人员推出了一种名为 DANCE 的新方法,用于弱监督目标检测 (WSOD),旨在提高准确性,而无需精确的边界框标注。DANCE 通过使用热图引导的建议选择器生成更准确的伪真实边界框来解决现有方法的局限性,这些边界框能够捕捉整个对象并区分相邻实例。它还结合了背景类别表示和负确定性监督,以加速收敛并弥合语义鸿沟。
-
YOLOv8与YOLO26目标检测模型比较
一篇新的研究论文比较了YOLOv8和YOLO26这两个目标检测模型在各种尺度和数据集上的性能。研究发现在Pascal VOC数据集上,YOLO26通常提供更好的检测精度和更低的模型复杂度。然而,在VisDrone数据集上,性能差异减小,尤其是在密集、小目标检测方面,而YOLOv8在GPU延迟方面保持了竞争优势。研究结果表明,最佳模型选择取决于具体的数据集特征、目标尺度、模型容量和硬件限制。
-
新的TsallisPGD攻击方法改进了对语义分割模型的对抗性攻击
研究人员开发了TsallisPGD,一种新颖的对抗性攻击方法,旨在更有效地针对语义分割模型。这种新方法利用Tsallis交叉熵(标准交叉熵的广义形式)来适应性地调整跨像素的梯度加权。在Cityscapes和Pascal VOC等数据集上的实验表明,TsallisPGD在降低模型准确性和平均交并比(mIoU)方面优于现有方法。