PulseAugur
实时 07:18:52
实体 YOLOv5

YOLOv5

PulseAugur coverage of YOLOv5 — every cluster mentioning YOLOv5 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 14
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 15 条
  1. TOOL · CL_229285 ·

    轻量级YOLOv5框架在不丹检测番茄生长阶段

    研究人员开发了一个基于YOLOv5的轻量级目标检测框架Pheno-Lite + Efficient Channel Attention (ECA),用于识别不丹资源受限温室中的番茄生长阶段。该模型集成了专门的主干模块,以增强特征提取和通道交互,实现了高精度和高召回率。该框架专为在严峻的农业环境中进行实时部署和气候适应性而设计。

  2. TOOL · CL_212215 ·

    新的 YolovN-CBi 架构增强了小型无人机的实时检测能力

    研究人员开发了一种名为 YolovN-CBi 的新型轻量级架构,专为实时检测小型无人机 (UAV) 而设计。该架构集成了卷积块注意力模块 (CBAM) 和双向特征金字塔网络 (BiFPN),以增强对小型目标的检测能力。在基准数据集和自定义本地数据集上的评估表明,Yolov5-CBi 变体在小型目标检测的速度-准确性权衡方面优于 YOLOv8 和 YOLOv12 等较新的 YOLO 版本。此外,使用知识蒸馏创建的 CBi 架构的蒸馏版本…

  3. TOOL · CL_206551 ·

    低成本AI系统在边缘设备上检测织物缺陷

    研究人员开发了一个两阶段织物缺陷检测系统,专为在NVIDIA Jetson Nano等边缘设备上进行低成本部署而设计。该系统使用轻量级自编码器进行初步筛选,然后使用YOLOv5n模型仅对标记的帧进行更详细的分析。与单阶段检测器相比,这种级联方法旨在降低计算成本并提高推理速度,尽管研究指出JPEG解码等数据路径开销会显著影响整体加速效果。研究结果表明,虽然级联方法具有潜在的效率提升,但要实现速度优势,必须仔细考虑整个数据管道。

  4. TOOL · CL_196020 ·

    新研究评估非洲作物检测的AI模型

    arXiv上发表的一项新研究评估了六种用于农业应用的物体检测模型,特别关注非洲真实农田条件下的作物检测。该研究使用了AgriAISeg数据集,该数据集包含来自尼日利亚的超过3300张芝麻、卷心菜和番茄作物的图像。RT-DETR表现最佳,取得了最高的精确率和mAP分数,而YOLOv8和YOLO11也表现出稳健的结果。研究发现,Faster R-CNN在复杂的田间场景中效果较差,这凸显了现代单阶段和基于Transformer的检测器在农业…

  5. TOOL · CL_194123 ·

    雪地地形无人机与地面机器人导航系统

    研究人员开发了一种新颖的导航框架,用于在具有挑战性的雪地地形中运行的无人机和地面机器人。该系统利用高效的U-Net架构进行实时道路分割,通过合成雪数据增强实现了96.5%的准确率。无人机采用扩展卡尔曼滤波器集成GPS和IMU数据进行定位,最大位置误差为0.5米。地面机器人的位置通过无人机的RGB-D摄像头数据和YOLOv5对象检测进行跟踪,从而能够进行考虑雪堆的动态路径规划。

  6. TOOL · CL_184505 ·

    EigenCAM 在 YOLOv5 目标检测中优于 Grad-CAM++

    文章解释了为什么 EigenCAM 是 YOLOv5 等目标检测模型的优于 Grad-CAM++ 的选择。突出的主要优势是 EigenCAM 使用特征通道上的主成分分析 (PCA),这有效地减轻了多尺度检测场景中固有的梯度噪声。

  7. RESEARCH · CL_172034 ·

    AI模型在中国农村道路上表现不佳;合成数据提供部分解决方案

    研究人员开发了一个新的数据集和评估方法,用于中国农村自动驾驶场景下的目标检测,以解决数据稀缺的挑战。该研究将河南省卫辉市的真实世界数据与使用Unreal Engine生成的合成数据混合,创建了一个包含14个类别的目标系统。通过评估13种主流检测器,他们发现适量的合成数据可以提高性能,其中YOLO11m取得了最高的[email protected]。然而,过多的合成数据会导致域偏移,并且检测长尾、非标准物体仍然存在挑战。

  8. TOOL · CL_169844 ·

    YOLOv7-Large 在古钱币字符识别方面实现了 90.4% 的 mAP50

    研究人员开发了一种使用 YOLO 变体对古罗马共和国钱币进行字符识别的深度学习方法。他们创建了一个包含 5,654 枚钱币图像和 38,808 个标注(用于 21 个字符标签)的新数据集。YOLOv7-Large 表现最佳,mAP50 达到 90.4%,优于其他 YOLO 版本。

  9. TOOL · CL_154615 ·

    新的AdvSerial框架实现了对行人检测器的物理对抗攻击

    研究人员开发了AdvSerial,这是一个用于针对交通摄像头和智慧城市监控等基础设施中使用的行人检测系统创建物理对抗攻击的新颖框架。该方法使用动态2D-3D联合优化来生成服装上的对抗性补丁,专门抑制特定于人的特征,同时保持时间连续性。在实验中,AdvSerial在YOLO-v5上实现了74.8%的攻击成功率,并显著降低了检测置信度,证明了其在各种检测器架构上的强大可迁移性以及对NapGuard和Sparse4D-v3等防御措施的抵抗力。

  10. RESEARCH · CL_152102 ·

    新研究解决目标检测模型的标注效率问题

    两篇新研究论文探讨了提高目标检测标注效率的先进方法。第一篇论文介绍了一个基础模型协作主动学习框架,该框架使用双源不确定性估计和以对象为中心的多元化采样来增强样本选择,并减少遥感图像的手动标注负担。第二篇论文提出了一种用于机器人的具身主动学习方法,该方法优化导航轨迹并根据空间一致性选择信息图像,以便在有限的标注和导航预算下重新训练目标检测器。

  11. RESEARCH · CL_143572 ·

    大型视觉-语言模型在SOTIF合规的自动驾驶车辆目标检测方面展现出潜力 · 跟踪2个来源

    一项新的研究论文评估了大型视觉-语言模型(LVLMs)在自动驾驶系统中的二维目标检测能力,重点关注预期功能安全(SOTIF)条件。该研究使用了PeSOTIF数据集,将包括Gemini 3在内的十个LVLMs与YOLOv5和RT-DETRv4等专用检测器进行了比较。结果表明,在自然退化条件下,顶尖的LVLMs展现出更高的召回率和与专用检测器相当的性能,尽管在特定扰动下,后者的几何精度仍具有优势。

  12. TOOL · CL_129198 ·

    AI模型以99%的准确率实现白细胞分析自动化

    研究人员开发了一种新颖的混合机器学习模型LeukocyteCount,用于自动识别和计数血样中的白细胞。该模型集成了Yolov5进行初步检测,准确率达到98%,然后采用MobileNetV2和Logistic Regression的组合将其分类为四种类型,准确率高达99.04%。该系统还包括一个基于Yolov5的模块,用于检测红细胞,F1分数达到99.73%。这种方法旨在克服手动方法的局限性,为疾病诊断和监测提供更有效、更准确的解决方案。

  13. RESEARCH · CL_119379 ·

    新的WIDER-FAIR数据集揭示面部检测模型的偏见

    研究人员推出了WIDER-FAIR,一个旨在评估面部检测模型公平性的新数据集。WIDER-FAIR建立在WIDER-FACE基准之上,包含对16,256张图像和四个族裔群体(亚洲人、黑人、印度人和白人)的感知族裔和性别的手动注释。使用在该数据集上训练的YOLOv5模型的初步实验显示,对黑人个体的面部检测性能显著较低,并且将该群体排除在训练之外比排除任何其他人口群体更能加剧公平性差异。

  14. TOOL · CL_108140 ·

    新的PNAFusion方法提高了多光谱目标检测效率

    研究人员开发了一种名为渐进式像素邻域可变形交叉注意力(PNAFusion)的新方法来改进多光谱目标检测。该方法通过将特征交互和对齐集中在相关的局部邻域上来解决全局交叉注意力的计算成本问题。PNAFusion包含一个像素邻域交叉注意力模块以减少冗余匹配,以及一个自适应可变形对齐模块以捕捉非线性空间对应关系,并采用迭代反馈机制进行渐进式精炼。实验表明,在FLIR和M3FD等数据集上取得了显著的性能提升,实现了高mAP分数,同时与现有方法相…

  15. TOOL · CL_14886 ·

    AI驱动的应用程序将视觉数据转化为盲人的听觉反馈

    一款名为 SoundSight 的新 AI-Sight 应用程序已被开发出来,旨在为使用移动技术的视障人士提供听觉反馈。该应用程序利用 DeepLabV3、YOLOv5 和 YOLOv8 等 AI 模型来解释设备摄像头和 LiDAR 传感器的视觉信息。然后,系统将这些感官数据转化为语义听觉提示,旨在增强盲用户的导航和环境感知能力。