YOLO
PulseAugur coverage of YOLO — every cluster mentioning YOLO across labs, papers, and developer communities, ranked by signal.
16 天有情绪数据
-
新型模块化代理增强医学CT扫描中的空间推理能力
研究人员开发了一种模块化代理,旨在改进医学影像的空间推理能力,特别是用于验证CT扫描中的空间关系。该代理将任务分解为语言解析、使用基于YOLO的检测器进行解剖定位以及确定性几何验证,而不是依赖端到端的视觉-语言模型。在MIRP空间问答基准测试中的评估显示,这种混合方法达到了94.1%的准确率,显著优于Qwen2-VL等模型的直接提示,并提供了可解释的推理阶段。
-
无人机和人工智能革新基础设施检查,新综述发现
一项新的文献综述和框架提案详细介绍了在建筑、工程、施工和设施管理(AEC+FM)领域使用无人机(UAVs)进行基础设施检查。该论文综合了150多项研究,重点介绍了数据采集、缺陷检测和决策支持的方法,并结合了YOLO和Faster R-CNN等先进的机器学习模型。它还讨论了RGB图像、LiDAR和热成像传感与基于Transformer的架构的集成,以提高识别结构缺陷和异常的准确性。研究确定了实时处理和多模态数据融合方面仍存在的挑战,并提…
-
新框架通过连续性学习提升工业缺陷检测能力
研究人员开发了一种新的连续性驱动表示学习框架,以改进工业缺陷检测。该方法利用以正常为主的区域作为密集辅助监督,引入了两个与检测器无关的目标:多连续性损失和差分损失。在工业数据集和NEU-DET基准上的实验表明,在包括YOLO和DETR模型在内的各种检测器架构上,尤其是在数据有限的条件下,性能得到了一致的提升。
-
新的arXiv研究比较了用于军事目标检测的AI模型
一篇新发表在arXiv上的研究论文详细介绍了一项关于自动目标检测与识别(ATD/R)的开箱即用技术的比较研究。该研究在与军事相关的数据库上对多个YOLO版本和DETR框架变体进行了基准测试,评估了它们在VisDrone数据库上进行微调前后的性能。主要发现表明,更大的模型性能更好,基于DETR的模型显示出潜力,并且虽然在域外数据库上进行微调可以提高性能,但在域内训练对于有效的ATD/R系统,尤其是在空对地场景中检测小型目标方面,仍然至关重要。
-
新的SPK框架通过结构化先验知识增强目标检测的可靠性
研究人员开发了一个名为结构化先验知识(SPK)的新框架,以提高实时目标检测系统中分布外(OoD)目标的检测能力。SPK从预训练的目标检测器中显式提取潜在的语义、几何和上下文先验知识,创建一个紧凑且可解释的五维表示。该方法在各种OoD基准测试中展示了最先进的性能,表明目标检测器包含比之前假设的更多可利用的知识,以增强预测的可靠性。
-
EdgeCrafter: 紧凑型ViT用于边缘密集预测
研究人员开发了EdgeCrafter,这是一个新的框架,利用专为边缘设备上的密集预测任务设计的紧凑型Vision Transformers (ViTs)。该框架解决了在严格的计算和内存限制下部署高性能模型的挑战,而传统上CNN架构(如YOLO)在此领域占据主导地位。EdgeCrafter采用任务专用蒸馏和对边缘友好的编码器-解码器设计,使紧凑型ViTs在物体检测、实例分割和姿态估计方面能够实现具有竞争力的精度-效率权衡。
-
新的单目视觉方法无需标定即可估计车辆速度
研究人员开发了一种从单目视频估计车辆速度的新方法,无需相机标定或道路特征。该方法利用一个36关键点的车辆模板和一个单应性矩阵,并使用一个基于YOLO的模块进行关键点检测。该框架允许使用仅关键点跟踪或变形光流进行速度估计,将位移投影到度量空间。该方法已在超过400个视频片段上得到验证,并在VS13和BrnoCompSpeed数据集上展示了可靠的速度估计,实现了较低的平均绝对误差。
-
合成数据可提升在热成像和恶劣条件下的无人机检测能力 · 跟踪 2 个来源
两篇研究论文探讨了使用合成数据来改进无人机检测系统,特别是在具有挑战性的热成像和恶劣天气条件下。第一篇论文侧重于热成像,证明合成数据可以作为有效的初始训练集,即使少量真实数据也能显著缩小领域差距并提高性能。第二篇论文介绍了 SynDroneVision-Weather (SDV-W),这是一个旨在涵盖季节和天气变化的合成数据集,表明它在补充通用合成数据时可以提高检测器的可靠性并减少错误。
-
MITE-Net: SWaP 优化的嵌入式边缘 SAR 4K 视频微小目标感知
研究人员开发了 MITE-Net,这是一种专为嵌入式边缘合成孔径雷达 (SAR) 任务设计的、用于 4K 视频中实时微小目标感知的创新架构。该系统针对尺寸、重量和功耗 (SWaP) 约束进行了优化,解决了下采样造成的特征丢失和基于切片处理的延迟问题。MITE-Net 集成了一个无学习的基于运动的区域提议网络和一个类似小型 R-CNN 的头部,并在新构建的 SAR-Tiny 数据集上进行了评估。在 NVIDIA Jetson AGX X…
-
LightTeaNet:用于茶叶病害检测的轻量级CNN
研究人员开发了LightTeaNet,一种轻量级卷积神经网络(CNN),用于检测和定位茶叶病害。这种弱监督模型直接从图像级标签中学习,并使用类激活映射(CAM)进行自动定位,无需YOLO等模型所需的广泛边界框标注。LightTeaNet集成了深度可分离卷积以提高参数效率,并结合通道注意力以增强特征辨别力,实现了0.9615的精确率和0.8772的召回率。
-
新框架改进图像恢复与目标检测的协同作用
研究人员引入了一个名为“利普希茨正则化目标检测”(LROD)的新框架,以改善图像恢复和目标检测任务之间的协同作用。该框架解决了这两种神经网络之间功能不匹配所带来的不稳定性问题,即恢复过程中的平滑变换可能会被放大成对检测器具有破坏性的噪声。通过在训练过程中协调两项任务的利普希茨连续性,LROD提高了检测的稳定性和准确性,尤其是在雾霾和弱光等不利条件下。所提出的方法已实现为“利普希茨正则化YOLO”(LR-YOLO),可以无缝集成到现有的…
-
AI框架利用视频诊断蚊子传播的登革热病毒
研究人员开发了一个新颖的视觉-语言框架,利用YOLO和对比语言-图像预训练(CLIP)技术,通过视频数据诊断蚊子感染登革热2型病毒(DENV2)的情况。该系统首先使用YOLO分离蚊子区域,然后将视觉特征与文本提示在共享的嵌入空间中对齐。该多模态模型在帧级别达到了98.54%的准确率和99.91%的灵敏度,在进行时间聚合后,实现了完整的视频级别性能。研究强调了微调和基于CLIP的表示在此应用中的关键作用,表明视觉-语言模型在从视频分析与…
-
新协议增强自动驾驶安全测试
研究人员推出了一种名为RISC(Risk-Informed Slice Coverage,基于风险的切片覆盖)的新协议,旨在提高自动驾驶系统的安全性和评估水平。该协议通过关注高风险驾驶条件并提供明确的覆盖证据来指导测试。通过将有限的审计预算导向相关数据子集,RISC旨在比随机抽样更有效地发现关键故障。概念验证表明,RISC能够显著增加行人感知模块中关键故障的发现率。
-
MammoMix 使用专家混合模型实现鲁棒的乳腺钼靶图像检测
研究人员开发了 MammoMix,一个利用专家混合(MoE)范式来改进乳腺钼靶图像中乳腺病灶检测的新框架。该方法在特定数据集上训练独立的专家模型,使它们能够专注于不同的数据特征。然后,一个门控机制自适应地组合这些专家的输出,增强了领域自适应推理和整体鲁棒性。该框架还包括一个校准模块 MoCAE,用于调整置信度分数并提高可靠性,在不同乳腺钼靶数据集上的表现优于基线检测器。
-
真实数据在无人机野火检测模型上的表现优于合成数据
一篇新的研究论文探讨了不同数据集组成对于在无人机(UAV)上进行实时野火检测的紧凑型YOLO模型训练的有效性。该研究评估了四种配置:真实数据未增强、真实数据已增强、混合数据未增强(结合真实图像和AI生成图像)以及混合数据已增强。与预期相反,未增强的真实数据集产生了最佳性能,在无人机检测的召回率和平均精度方面表现出更优的平衡。研究结果表明,对于这种特定应用,数据集的真实性和领域对齐比合成数据扩展或增强更关键。
-
新的SkySeaLand基准针对卫星目标检测挑战
研究人员推出了SkySeaLand,这是一个专为卫星目标检测设计的新基准数据集,特别关注宽幅场景和小目标。该数据集包含1,307张高分辨率卫星图像,对飞机、船只和舰船等交通相关目标进行了超过19,000个标注。同时,他们开发了SkyDet,一个具有小尺寸和高效推理速度的超轻量级检测基线模型。
-
新的Fiji/ImageJ插件通过YOLO简化神经元分割
研究人员开发了NeuroAdaptTrainer,这是一个用于Fiji和ImageJ的新型开源插件,旨在简化神经科学中的神经元分割。该插件集成了YOLO实例分割模型,使用户能够自动检测神经元,在软件内手动校正结果,并通过迁移学习使模型适应新的成像条件。该工具旨在使非专业用户更容易获得基于深度学习的分割方法,同时保持专家监督。
-
YOLO-PEFT框架增强了实时目标检测器的微调性能
研究人员开发了YOLO-PEFT,一个旨在改进YOLO等实时目标检测模型参数高效微调(PEFT)的新框架。与可能因检测器复杂结构而失败的通用PEFT方法不同,YOLO-PEFT采用一种感知结构的方来规划适配器放置,确保兼容性并避免静默失败。该方法在YOLO11s和YOLO12s上实现了比完整微调更高的mAP分数,并在YOLO11上将峰值训练内存减少了近44%,尽管训练时间有所延长。
-
无人机使用可解释模糊推理进行目标跟踪
研究人员开发了一个可解释的模糊推理框架,用于引导无人机(UAV)跟踪地面目标。该系统从YOLO边界框中提取低维特征,如质心位置、面积和纵横比,以生成连续的偏航指令,而无需显式的几何建模或大型数据集。一个具有27条规则的Takagi-Sugeno模糊模型在VICON运动捕捉环境中实现了0.140度的平均绝对误差,证明了其适用于实时、资源受限的应用。
-
新框架评估文本到图像模型中的比喻理解能力
研究人员开发了一个新框架,用于评估文本到图像模型理解比喻的能力。尽管这些模型能产生视觉上吸引人的结果,但它们常常无法理解比喻的含义,将喻体与本体混淆。该框架包括一个受控数据集,使用YOLO检测进行基础度量,并使用Diffusion Lens分析文本编码器层,以识别字面化失败的模式并探索潜在的改进。