PulseAugur
中
实时 18:17:22
实体 object detection

object detection

PulseAugur coverage of object detection — every cluster mentioning object detection across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
31
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
28
90 天内 28
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. RESEARCH · CL_273527 ·

    AI研究探索用于目标检测和视频合成检测的合成数据

    两篇新的arXiv论文探讨了AI检测和泛化方面的进展。第一篇论文回顾了目标检测的域泛化,强调了合成数据作为赋能者和探针的作用,并讨论了合成到真实的差距。第二篇论文介绍了一种使用首位数字梯度统计的可泛化、可解释的合成视频检测框架,该框架无需依赖生成器特定特征即可深入了解其检测机制。

  2. TOOL · CL_231738 ·

    Spiking Patches 标记化将事件相机效率提升 10 倍

    研究人员开发了一种名为 Spiking Patches 的新方法来处理事件相机的数据,事件相机捕获异步稀疏的视觉信息。这种新颖的标记化技术保留了事件相机的独特性质,而之前的基于帧或体素的方法则无法做到。实验表明,Spiking Patches 与图神经网络 (GNNs)、PCN 和 Transformers 结合使用时,在手势识别和物体检测等任务中可以达到相当或甚至更优的准确性,同时将推理时间显著缩短高达 10.4 倍。

  3. TOOL · CL_229500 ·

    新框架 ReVISE 增强 MLLM 在视觉任务中的可靠性

    研究人员开发了一个名为 ReVISE 的新框架,以提高多模态大型语言模型(MLLM)在使用外部工具进行视觉任务时的可靠性。该框架使 MLLM 能够验证对象检测和深度估计等工具的输出,并动态纠正错误。ReVISE 包括一个用于训练反思行为的精选数据集,并使用强化学习来鼓励内部反思并惩罚不匹配,从而在基准测试中取得持续改进。

  4. TOOL · CL_218269 ·

    新方法使 Vision Transformers 适应更快的物体检测

    研究人员开发了一种名为 Detector-Interface Distillation (DiD) 的新方法,将 Vision Transformers (ViTs) 从 Softmax 注意力适配到线性注意力,用于物体检测任务。这种无标签的方法侧重于保留检测器的预期特征张量,而不仅仅是模仿内部状态,从而在 DOTA-v1.5 等数据集上实现了显著的性能提升。适配过程速度很快,大约需要 87 分钟完成,推理延迟减少了约 62%,峰值内…

  5. TOOL · CL_218023 ·

    新的HCFormer架构使用双曲聚类实现可解释的视觉模型

    研究人员开发了HCFormer,这是一种新的视觉骨干架构,它利用双曲层次聚类进行视觉表示学习。这种名为ClusterMixer的方法,为视觉Transformer等模型中发现的传统token mixer提供了一种更具可解释性的替代方案。通过在双曲空间中进行聚类以捕捉层次关系,HCFormer在各种计算机视觉任务(包括图像分类和分割)中表现出稳健的性能。

  6. RESEARCH · CL_206406 ·

    新的AdROD系统增强了自动驾驶目标检测的对抗鲁棒性

    研究人员开发了AdROD,一种旨在增强自动驾驶汽车目标检测对抗鲁棒性的新型防御系统。AdROD利用低秩超网络,显著降低计算开销,实时生成多样化检测器。该方法旨在对抗可能抑制目标检测的物理对抗攻击,这是自动驾驶系统的关键漏洞。该系统包括两种模式:AdROD-I用于持续保护,AdROD-II用于按需激活,在模拟环境和真实世界补丁测试中表现优于现有防御措施。

  7. TOOL · CL_194131 ·

    无线5G系统增强工业领域的人机协作

    研究人员开发了一个基于5G的无线系统,以增强工业环境中的人机协作(HRC),特别是对于需要频繁重新配置工作单元的任务。该系统利用了一种新颖的电池供电、多传感器平台和一个用于物体检测、姿态估计和鲁棒手部识别的计算机视觉模块。该设置旨在克服传统有线基础设施的局限性,从而在再制造和操作员培训等应用中实现更大的灵活性和安全性。

  8. TOOL · CL_183409 ·

    FaithIR框架增强红外图像超分辨率以提升机器感知能力

    研究人员推出了一种新颖的FaithIR框架,旨在改进红外图像超分辨率(IISR)以增强机器感知能力。与以往常引入人工纹理或扭曲热结构的方法不同,FaithIR专注于保留真实的热和结构信息。该框架采用双分支方法,一个分支捕捉全局信息,另一个分支在结构完整性指导下进行局部重建。实验表明,FaithIR不仅实现了卓越的重建保真度,还显著提高了目标检测和语义分割等下游任务的性能,凸显了忠实保留结构比单纯追求感知锐度更重要。

  9. TOOL · CL_181656 ·

    语义分割:计算机视觉中的像素级理解

    语义分割是一种计算机视觉技术,它为图像中的每个像素分配一个特定的类别标签。这个过程使模型能够创建详细的地图,在像素级别区分道路、人或缺陷等元素,这对于自动驾驶和医学成像等应用至关重要。与分类或对象检测不同,语义分割通过分析每个单独的像素来提供更精细级别的理解。

  10. TOOL · CL_169729 ·

    人工智能系统现在可以更谨慎地检测低图像质量下的物体

    研究人员开发了一种新方法,用于提高人工智能系统在面对低质量图像数据时的可靠性,尤其是在自动驾驶领域。该方法采用一种“故障降级”系统,该系统根据估计的图像质量降低网络的置信度阈值,从而在不确定的条件下实现更谨慎的物体检测。该方法利用归一化流将输入图像与训练数据进行比较,使人工智能能够更好地处理噪声或黑暗,而无需备用解决方案,从而增强了对人工智能系统的信任。

  11. TOOL · CL_166072 ·

    Apple发布GH-ESD用于发现视觉模型错误

    Apple的机器学习研究团队推出GH-ESD,一个用于发现视觉任务中实例级误差切片的新颖框架。该方法将切片发现重新构建为基于假设生成和统计验证,利用大型语言模型和视觉-语言模型构建关系性故障假设。GH-ESD旨在提高模型在目标检测和分割等任务中的鲁棒性和评估能力,在一个新的基准数据集上显著优于现有方法。

  12. COMMENTARY · CL_148091 ·

    多目标跟踪:赋予AI系统超越目标检测的记忆能力

    多目标跟踪(MOT)是目标检测的一项进步,它为视频流中识别出的对象提供了身份、记忆和历史背景。这对于自动驾驶和零售分析等应用至关重要,在这些应用中,理解场景如何随时间演变至关重要。与将每一帧独立处理并存在闪烁和对象“遗忘”问题的纯目标检测不同,MOT通过赋予计算机记忆能力,实现了更智能的系统。

  13. RESEARCH · CL_139310 ·

    新型攻击针对事件驱动型SNN,延迟增加38%

    研究人员开发了一种名为事件突发触发器(EBT)的新型可用性后门攻击,专门针对用于目标检测的事件驱动型脉冲神经网络(SNN)。该攻击将触发器注入训练数据中,在推理过程中导致时间上集中的事件流,显著增加了非极大值抑制(NMS)等后处理阶段的计算负载。虽然EBT在很大程度上保持了检测精度,但可能将NMS延迟最多增加38%,从而可能成为瓶颈。该攻击还会微妙地提高边缘平台的资源利用率,而不会出现明显的峰值,并且STRIP等标准检测方法难以识别它。

  14. TOOL · CL_135473 ·

    机器学习评估指标详解:准确率、IoU、mAP等

    评估指标对于评估机器学习模型的性能至关重要,尤其是在目标检测任务中。关键指标包括准确率(在不平衡数据集上可能产生误导)和混淆矩阵(提供真阳性、真阴性、假阳性和假阴性的详细分类)。精确率、召回率和F1分数从混淆矩阵中衍生出进一步的见解,平衡了分类准确率的不同方面。对于目标检测,交并比(IoU)衡量预测框与真实框的重叠程度,而平均精度(AP)和平均精度均值(mAP)则总结了不同召回率水平和对象类别的性能。

  15. TOOL · CL_131552 ·

    新框架评估合成雾中的无人机检测与跟踪

    研究人员开发了一个新的框架,用于评估在雾天条件下无人机(UAV)的检测和跟踪能力。该框架使用从真实图像生成的合成雾来测试各种图像恢复方法及其对目标检测和跟踪性能的影响。研究发现,雾会显著降低检测和跟踪性能,其中包含雾的训练提供了最稳健的改进,而测试时恢复在仅在清晰图像上训练的模型时最有效。研究强调,恢复质量并不总是与下游感知任务的改进直接相关。

  16. TOOL · CL_128744 ·

    联邦学习实现协同无人机目标检测,无需数据集中化

    研究人员开发了一种用于目标检测的联邦学习方法,使无人机能够在不集中其数据的情况下协同训练共享模型。该方法解决了分布式无人机部署中固有的隐私和带宽挑战。使用 KIIT-MiTA 数据集和 YOLO26 nano 模型进行的实验表明,联邦学习在性能上接近集中式训练,并且在平均精度方面显著优于单无人机训练。

  17. TOOL · CL_121633 ·

    合成雾管道减少了自动驾驶汽车物体检测的数据需求

    研究人员开发了Clear2Fog (C2F),一个基于物理的管道,用于生成合成雾以训练物体检测模型。该方法旨在通过解决真实世界雾天数据稀缺的问题来提高自动驾驶汽车的安全性。C2F集成了单目深度估计和新颖的大气光估计,以创建物理上一致的合成雾,减少伪影和偏差。一项使用Waymo开放数据集进行的广泛研究表明,在较低规模下使用不同雾密度进行训练,可以达到在较大固定密度数据集上训练的模型的性能,从而将合成数据需求减少25%。

  18. RESEARCH · CL_119662 ·

    新的GoodQ方法使用生成模型进行零样本目标检测器量化

    研究人员开发了GoodQ,一种用于零样本量化感知训练(ZSQ-OD)的新流程,该流程利用现成的生成模型来创建训练数据集。该方法解决了目标检测模型合成数据固有的密集图像信息、类别分布不平衡和伪标签噪声等挑战。GoodQ采用信息密集型提示、内在分布感知选择和教师引导自适应降噪技术,在W4A4等低比特量化场景下以及扩展到W3A3等极端比特宽度下取得了最先进的性能。

  19. TOOL · CL_118004 ·

    新的键相关层注意力为神经网络提供线性复杂度

    研究人员开发了一种新颖的机制——键相关层注意力(KCLA),旨在改进神经网络中不同层之间的交互方式。KCLA通过实现线性复杂度来解决传统层注意力的二次计算复杂度问题,其灵感来源于对层注意力中键表示显示出高余弦相似性的观察。这种新方法保持了动态信息更新和有效的长距离跨层依赖性,性能优于循环层注意力和线性注意力等现有方法。KCLA在图像识别、物体检测和医学图像分割等各种应用中表现出色,并且其代码已公开提供。

  20. RESEARCH · CL_111334 ·

    TaskTok框架通过选择性令牌恢复增强下游视觉任务

    研究人员推出TaskTok,一个新颖的、用于任务驱动图像恢复(TDIR)的框架。与关注感知质量的传统方法不同,TDIR旨在提高后续高级视觉任务的性能。TaskTok通过选择性地恢复与任务相关的令牌,解决了先前生成先验方法在计算效率和潜在语义改变方面的问题。这种选择性恢复是通过一个可学习的令牌开关和一个轻量级细化模块实现的,在图像分类、语义分割和目标检测方面表现出显著的增强,同时提高了计算效率。