Faster R-CNN
PulseAugur coverage of Faster R-CNN — every cluster mentioning Faster R-CNN across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
专家图像标注提升AI计算机视觉模型
本文讨论了专家图像标注在改进计算机视觉和物体检测模型方面的重要作用。它强调了精确的边界框和一致的标签对于创建高质量的AI训练数据至关重要。该帖子还指向了学习图像标注技术的资源,特别提到了YOLO和Faster R-CNN。
-
无人机和人工智能革新基础设施检查,新综述发现
一项新的文献综述和框架提案详细介绍了在建筑、工程、施工和设施管理(AEC+FM)领域使用无人机(UAVs)进行基础设施检查。该论文综合了150多项研究,重点介绍了数据采集、缺陷检测和决策支持的方法,并结合了YOLO和Faster R-CNN等先进的机器学习模型。它还讨论了RGB图像、LiDAR和热成像传感与基于Transformer的架构的集成,以提高识别结构缺陷和异常的准确性。研究确定了实时处理和多模态数据融合方面仍存在的挑战,并提…
-
新的SPK框架通过结构化先验知识增强目标检测的可靠性
研究人员开发了一个名为结构化先验知识(SPK)的新框架,以提高实时目标检测系统中分布外(OoD)目标的检测能力。SPK从预训练的目标检测器中显式提取潜在的语义、几何和上下文先验知识,创建一个紧凑且可解释的五维表示。该方法在各种OoD基准测试中展示了最先进的性能,表明目标检测器包含比之前假设的更多可利用的知识,以增强预测的可靠性。
-
AI息肉检测模型因数据集偏差在实际测试中失败
一项新的研究论文介绍TRUE-Colon,一个旨在揭示AI模型在精心策划的医学数据集上训练的性能与在真实临床环境中的性能之间差距的基准测试协议。研究发现,仅在以病灶为中心的基准上训练的模型,在完整结肠镜检查程序上进行评估时,准确性会显著下降。相反,在完整程序上训练的模型在精心策划的基准上保持了准确性,同时在真实场景中更好地排除了非息肉内容。该研究建议将完整程序数据用于训练和基准测试,以提高AI驱动的息肉检测系统的可部署性。
-
新研究评估非洲作物检测的AI模型
arXiv上发表的一项新研究评估了六种用于农业应用的物体检测模型,特别关注非洲真实农田条件下的作物检测。该研究使用了AgriAISeg数据集,该数据集包含来自尼日利亚的超过3300张芝麻、卷心菜和番茄作物的图像。RT-DETR表现最佳,取得了最高的精确率和mAP分数,而YOLOv8和YOLO11也表现出稳健的结果。研究发现,Faster R-CNN在复杂的田间场景中效果较差,这凸显了现代单阶段和基于Transformer的检测器在农业…
-
新的SkySeaLand基准针对卫星目标检测挑战
研究人员推出了SkySeaLand,这是一个专为卫星目标检测设计的新基准数据集,特别关注宽幅场景和小目标。该数据集包含1,307张高分辨率卫星图像,对飞机、船只和舰船等交通相关目标进行了超过19,000个标注。同时,他们开发了SkyDet,一个具有小尺寸和高效推理速度的超轻量级检测基线模型。
-
新的黑盒攻击方法ColorFD针对遥感目标检测器
研究人员开发了ColorFD,一种新颖的、用于遥感目标检测的黑盒物理对抗性攻击方法。该方法利用多个纯色补丁,通过差分进化优化其位置和颜色。ColorFD在对抗YOLOv3u、YOLOv5u和Faster R-CNN等检测器方面表现出有效性,优于现有的黑盒补丁攻击,并与白盒方法保持竞争力。实际世界实验证实了这些优化补丁从数字模拟到真实世界成像条件的迁移能力。
-
深度学习模型推进公用设施电线杆和标志检测
研究人员开发了一个深度学习框架,用于检测、分割和估算公用设施电线杆的倾斜角度,并对附着的警示标志进行分类。该系统基于改进的检测Transformer (DETR) 模型,在包含4,570张来自Google Street View的标注图像的自定义数据集上进行了训练。这种方法优于RetinaNet和YOLOv3-Tiny等标准对象检测器,在电线杆和标志检测方面均实现了高平均精度。该框架还能生成掩码,用于准确估算电线杆倾斜角度,在测试集上…
-
发布用于Sentinel-1船舶检测的新型开放数据集OSSDD
研究人员推出OSSDD,这是一个专为训练神经网络在合成孔径雷达(SAR)图像中检测船舶而设计的新型开放数据集。该数据集基于OpenSARShip 1.0数据集构建,提供了15,197个Sentinel-1幅度图像块,并包含超过55,000艘船的详细标注。OSSDD包括二值船舶掩码、轴对齐边界框和旋转边界框,旨在作为未来SAR船舶检测实验的基准。该数据集可在Hugging Face上获取。
-
病理学基础模型在有丝分裂计数检测方面展现潜力
研究人员探索了病理学基础模型(FMs)作为有丝分裂计数检测编码器的有效性,将其应用从通常的分类任务扩展开来。该研究将几种基础模型,包括H-optimus-0和Virchow模型,与ResNet50基线进行了比较,并将它们集成到不同的检测架构中,如RetinaNet、Faster R-CNN和Deformable DETR。结果表明,H-optimus-0和Virchow模型表现出具有竞争力的性能,这表明通过图像级自监督训练的基础模型潜…
-
新方法生成用于装配分析的几何二维场景图
研究人员开发了一种新的几何二维场景图生成方法,该方法表示组件之间的装配关系。该方法利用Faster R-CNN模型的输出来创建几何表示,并通过Transformer架构处理以形成邻接矩阵。然后,该矩阵被输入到采用注意力图卷积网络(aGCN)进行消息传递的Siamese网络中,以表征组件连接。该方法在玩具模型组件的小型数据集上进行了验证,并且不需要语义数据。
-
大型视觉-语言模型在SOTIF合规的自动驾驶车辆目标检测方面展现出潜力 · 跟踪2个来源
一项新的研究论文评估了大型视觉-语言模型(LVLMs)在自动驾驶系统中的二维目标检测能力,重点关注预期功能安全(SOTIF)条件。该研究使用了PeSOTIF数据集,将包括Gemini 3在内的十个LVLMs与YOLOv5和RT-DETRv4等专用检测器进行了比较。结果表明,在自然退化条件下,顶尖的LVLMs展现出更高的召回率和与专用检测器相当的性能,尽管在特定扰动下,后者的几何精度仍具有优势。
-
MalariAI框架通过细胞分割和可解释性增强疟疾诊断
研究人员开发了MalariAI,一个新颖的两阶段框架,旨在提高从血涂片显微镜图像自动诊断疟疾的准确性和可靠性。该系统解决了现有深度学习模型的一些关键限制,例如不完整的注释处理和密集区域检测的抑制。MalariAI首先分离图像中的每个细胞,即使没有完整的地面真实情况也能实现高召回率,然后对单个细胞裁剪进行高精度分类,包括罕见的寄生虫阶段。该框架还通过热力图提供实例级别的空间证据,从而能够对预测进行临床审计和验证。
-
DefocusTrackerAI 使用 YOLOv9 进行粒子图像检测
研究人员开发了 DefocusTrackerAI,一个用于自动检测和估计散焦粒子图像位置的新深度学习框架。该系统利用 YOLOv9 架构,在检测各种光学设置和光照条件下的散光和非散光粒子方面,其性能优于 Faster R-CNN。该框架在荧光和阴影图数据等实际实验中取得了成功,表明其在喷雾和液滴跟踪等传统散焦粒子跟踪之外的应用潜力。
-
新 AI 方法利用参考图像突出显示 PCB 缺陷
研究人员开发了 RefDiffNet,这是一种新颖的输入增强模块,旨在提高印刷电路板 (PCB) 上细微缺陷的检测能力。该轻量级模块通过将有缺陷的 PCB 图像与无缺陷的参考图像进行比较来工作,突出显示表明缺陷的结构变化。当与 YOLOv8 和 Faster R-CNN 等各种深度学习检测器集成时,RefDiffNet 以最小的计算开销持续提升性能。
-
Meta AI 的 Detectron2 框架简化用于目标检测
本教程为计算机视觉任务提供了 Meta AI 的 Detectron2 框架的简化指南。它演示了如何构建 Faster R-CNN 管道,这是一种常用于精确目标检测的方法。该资源包括指向 Medium 文章的链接和配套代码,以供实际应用。
-
HeroCrystal框架推动隐私保护的多摄像头AI监控
研究人员开发了HeroCrystal,这是一个用于多摄像头监控系统中隐私保护对象检测的新框架。该系统通过扩散模型生成合成数据来增强数据集,同时不损害隐私,并解决类别不平衡问题。它在客户端设备上采用具有概率性Faster R-CNN的联邦学习,以及动态对比策略来减少域偏差,同时服务器融合来自异构架构的模型,而无需访问原始数据。
-
GPT Driver 使用 AI 和视觉技术自动化移动应用测试
MobileBoost 推出了 GPT Driver,这是一款人工智能驱动的工具,旨在自动化移动应用的端到端测试。该平台允许用户使用自然语言定义测试,利用大型语言模型推理和计算机视觉来减少测试的脆弱性和维护开销。这种方法旨在使端到端测试覆盖率更加易于访问,即使是非工程师也能使用,并且已经吸引了寻求简化 QA 流程的团队。