COCO
PulseAugur coverage of COCO — every cluster mentioning COCO across labs, papers, and developer communities, ranked by signal.
- used by Kingdom Hearts IV 90%
- instance of Lvis 70%
- used by Imagenet 1k 70%
- instance of Imagenet 1k 70%
- used by Vision Transformers 70%
- instance of ADE20K 70%
- used by Ms Coco 70%
- developed by Cortex Code 70%
- used by Cityscapes 70%
- used by Cortex Code 70%
- instance of Cityscapes 70%
- used by YOLOv12 70%
16 天有情绪数据
-
新的FD-CanKD框架提高了紧凑型目标检测器的准确性
研究人员开发了一个名为FD-CanKD的新知识蒸馏框架,旨在提高紧凑型目标检测器的准确性,同时不增加其参数数量。该方法在多个层面将知识从较大的教师模型转移到较小的学生模型:预测、上下文和频率。在COCO数据集上的实验表明,FD-CanKD可以显著提升紧凑型检测器的性能,在微调后达到48.87 mAP50:95的平均精度均值,而学生模型在训练后尺寸保持不变。
-
EdgeCrafter: 紧凑型ViT用于边缘密集预测
研究人员开发了EdgeCrafter,这是一个新的框架,利用专为边缘设备上的密集预测任务设计的紧凑型Vision Transformers (ViTs)。该框架解决了在严格的计算和内存限制下部署高性能模型的挑战,而传统上CNN架构(如YOLO)在此领域占据主导地位。EdgeCrafter采用任务专用蒸馏和对边缘友好的编码器-解码器设计,使紧凑型ViTs在物体检测、实例分割和姿态估计方面能够实现具有竞争力的精度-效率权衡。
-
YOLO26-RD网络通过新模块改进道路损坏检测
研究人员开发了YOLO26-RD,一个用于检测道路损坏的端到端网络,其中包含用于对比度增强和边缘引导下采样的创新模块。数据优先审计显示,与普遍假设相反,道路损坏检测并非主要是小目标问题。研究发现,线性裂缝是极端长宽比的结构,其检测难度在于灵敏度而非定位。这一分析促使了架构调整,从而提高了性能并缩短了处理时间。
-
Nexus模型提供与SDXL相当的高效文本到图像生成
研究人员推出了一种新颖的文本到图像生成模型Nexus,旨在提高效率。Nexus集成了稀疏架构、线性复杂度和低比特量化,结合了MoE前馈层和门控DeltaNet注意力。这种方法使Nexus在生成质量上可与SDXL和Stable Diffusion 3等成熟模型相媲美,同时显著提高了推理速度并降低了内存需求。在COCO和Laion数据集上进行的实验验证了其有效性。
-
AI模型自动从二维平面图检测MEP指标
研究人员开发了一个基于Mask RCNN的神经网络模型,用于从二维平面图中自动检测和提取机械、电气和管道 (MEP) 指标。该系统可以识别照明符号,确定其类型,并提取相关文本,旨在简化建筑和施工设计流程。该模型取得了强劲的性能指标,包括0.7596的bbox_mAP和0.7111的segm_mAP,被认为是迈向节能建筑设计工具的基础性一步。
-
王国之心动漫系列宣布将在 Disney+ 上线,讲述原创故事
基于王国之心电子游戏系列的全新动漫系列即将在 Disney+ 和 Disney Channel 首播。该系列将讲述一个原创故事,扩展现有传说,并引入游戏中的深受喜爱的角色以及各种迪士尼角色。该项目的开发由王国之心系列的总监兼角色设计师野村哲也(Tetsuya Nomura)以及 Square Enix 的创意团队监督。此外,还公布了王国之心 IV 的一瞥,其中将融入皮克斯《寻梦环游记》(Coco)的元素。
-
《王国之心IV》将包含一个受皮克斯《寻梦环游记》启发的关卡
即将推出的游戏《王国之心IV》将包含一个受皮克斯动画电影《寻梦环游记》启发的全新世界。这一消息是在迪士尼D23娱乐展上公布的,展会上还公布了该游戏的发布窗口,并宣布了新的《王国之心》动画系列。
-
《王国之心4》预告片发布,公布2027年发布日期和《寻梦环游记》世界
在D23活动期间,Square Enix发布了《王国之心4》的新预告片,确认了2027年末的发布窗口。预告片还展示了一个基于皮克斯《寻梦环游记》的世界,并宣布了一部新的Disney+动漫系列。该游戏预计将在Switch 2主机上发布。
-
新方法预测用于视觉实例分割的有符号距离函数
研究人员开发了一种新颖的视觉实例分割方法,通过训练神经网络来计算距离图。该方法预测每个像素到最近物体轮廓在不同方向上的距离,然后将这些距离进行池化以近似有符号距离函数(SDF)。虽然这种基于SDF的分割在前景IoU方面比COCO数据集上的最先进的YOLACT方法表现更好,但将距离图映射到完整的实例分割仍然是一个挑战。研究人员认为,这个方向有望更好地捕捉多样化的真实世界物体形状。
-
新框架通过域适应和类别几何增强开放词汇目标检测
研究人员正在开发新的开放词汇目标检测框架,旨在提高模型在遇到图像域偏移时的性能。PISA 是一种新颖的方法,它使用一种抗损坏特征提取器和特征对齐模块,在没有源数据的情况下适应预训练模型,在损坏的基准测试中取得了最先进的结果。另一种方法是类别几何监督 (CGS),它约束学习到的类别表示以保留视觉或语义上的差异,从而提高样本效率和新类别的插入能力,尤其是在数据稀缺的情况下。此外,还引入了一个名为稀疏标注开放世界目标检测 (SA-OWOD)…
-
理解人体姿态估计:模型、指标和方法
人体姿态估计模型通常输出预定义关节点坐标的数组,并附带每个关节点的置信度分数。这些关节点的顺序至关重要,因为模型本身不理解骨骼连接,这项任务留给用户的代码来完成。现代模型通常预测关节点位置的热力图,而不是直接预测坐标,这简化了训练,但可能导致量化误差,影响准确性,尤其对于较小的人物。处理多人的方法包括自顶向下方法(先检测每个人)和自底向上方法(先检测所有关键点然后将它们分组),每种方法都有其独特的失败模式。
-
Vision Transformers 的数据效率与其预训练一致性相关,而非固有偏置
一篇新的研究论文挑战了普遍的看法,即 Vision Transformers (ViTs) 在工业密集预测任务中比卷积神经网络 (CNNs) 需要更多的标记数据。该研究表明,感知到的数据效率差距主要是由于 ViT 主干和 CNN 颈部之间的预训练不一致性造成的,而不是 ViTs 的基本架构限制。研究人员提出了一种新颖的 AlignBlock 来重新校准特征,并证明通过适当的对齐,ViTs 在领域邻近数据集上可以优于 CNNs,而在领域…
-
新AI方法解决图像色彩还原和低光增强问题
研究人员正在开发新的方法来改进图像色彩还原和低光图像增强。一种方法提出了一个与亮度无关的框架,将色彩还原视为全RGB图像编辑,在不同灰度形成下表现出鲁棒性。另一种方法CAGE使用圆柱形颜色校正框架,通过自适应去偏和饱和度校正来解决低光图像中的颜色偏差。此外,正在探索一种检索增强生成技术,通过使用外部知识库来纠正残留的颜色偏移,从而恢复低光图像中的准确颜色。
-
TriView-YOLO模型提升了在复杂土壤条件下空洞的检测能力
研究人员开发了TriView-YOLO,这是一种新颖的深度学习模型,旨在检测具有挑战性的软土高含水量土壤中的地下空洞。该模型采用多视图融合方法,整合了探地雷达数据的三个不同视角,以提高检测精度。TriView-YOLO主要在泰国曼谷的路面调查中进行了测试,平均精度均值(mAP50)达到0.558,证明了其在传统方法难以应对的条件下的有效性。
-
新方法利用多模态伪标签和测试时自适应来增强开放词汇分割
研究人员开发了用于开放词汇实例和全景分割的新方法,旨在识别预定义类别之外的对象,而无需大量手动标注。一种方法,在 arXiv 论文中有所详述,使用 Grounded SAM 和 LLaVA 等模型生成的多模态伪标签,并通过 CLIP 引导过滤和 GPT 驱动的字幕重建进行增强。另一种方法,测试时原型自适应 (TPA),是一种无训练的即插即用模块,在输出层面运行,使用未标注的部署域图像从 DINO 特征构建类别原型,以提高分割准确性。
-
新模型定量选择最优迁移学习数据集
研究人员开发了TLDChoiceNet,一个旨在为图像分类任务定量选择最优迁移学习数据集的新模型。该系统旨在解决在可用训练数据有限的情况下,缺乏系统性方法来选择ImageNet、CIFAR-100或COCO等数据集的问题。TLDChoiceNet v2利用ImageNet预训练的ResNet50 v2嵌入,实现了0.031的均方误差,比简化版本提高了五倍。此外,还引入了两个无监督指标:分布距离(DD)和平均类别相关性(ACC)。ACC…
-
新的开放世界感知系统提升自动驾驶安全性
研究人员开发了一个新的开放世界分层感知系统,旨在通过更好地处理词汇表外(out-of-vocabulary)的道路对象来提高自动驾驶的安全性。与迫使未见对象接受错误标签的传统闭集检测器不同,该系统使用基于类无关(class-agnostic)提案的分类抽象。一项可行性研究表明,结合类无关分割、基于外观的分布外(out-of-distribution)评分和单目深度线索,可以使系统以高精度正确识别或标记未知对象,避免给出自信但错误的具体标签。
-
TriView-YOLO模型采用多视图融合技术检测困难土壤中的空腔
研究人员开发了TriView-YOLO,这是一种新颖的深度学习模型,旨在检测具有挑战性土壤条件下的地下空腔。该模型采用多视图方法,融合了三个不同的雷达扫描视角,以提高在传统方法难以应对的软土高含水层中的检测精度。TriView-YOLO主要在泰国曼谷的数据集上进行训练,在专门的测试集上取得了0.558的平均精度均值(mAP50),证明了其融合输入策略的有效性。
-
新的SkySeaLand基准针对卫星目标检测挑战
研究人员推出了SkySeaLand,这是一个专为卫星目标检测设计的新基准数据集,特别关注宽幅场景和小目标。该数据集包含1,307张高分辨率卫星图像,对飞机、船只和舰船等交通相关目标进行了超过19,000个标注。同时,他们开发了SkyDet,一个具有小尺寸和高效推理速度的超轻量级检测基线模型。
-
新的RegionDet基准挑战计算机视觉的以对象为中心的偏见
研究人员推出了RegionDet,一个旨在评估计算机视觉区域检测能力的新基准,超越了对单个对象实例的传统关注。该基准包含八个不同的区域类别,如建筑工地、损坏区域和群体对话,所有这些都以COCO风格的格式进行了标注。对现有检测器的初步评估显示,当前模型存在强烈的以对象为中心的偏见,表明在理解上下文相关和边界模糊的区域方面存在重大挑战。