COCO
PulseAugur coverage of COCO — every cluster mentioning COCO across labs, papers, and developer communities, ranked by signal.
- used by Kingdom Hearts IV 90%
- used by Imagenet 1k 70%
- instance of Lvis 70%
- used by ADE20K 70%
- instance of Imagenet 1k 70%
- used by Vision Transformers 70%
- instance of ScienceCast 70%
- instance of ADE20K 70%
- instance of alphaXiv 70%
- instance of CatalyzeX 70%
- used by Ms Coco 70%
- instance of Gotit.pub 70%
12 天有情绪数据
-
新指标增强了生成模型评估的可解释性
研究人员引入了一种名为方向性 Fréchet 距离的新指标,以更好地解释 Fréchet 距离,这是生成模型常用的评估指标。这种新指标将 Fréchet 距离分解为可解释的方向,揭示了生成分布与参考分布之间差异的具体方面。该方法已应用于图像、视频和蛋白质数据集,为评估分数提供了更清晰的解释,并揭示了 FID 和 FVD 等现有指标中的偏差。
-
AI研究探索高效的测试时特征获取和引导式生成
两篇新研究论文探讨了优化AI模型性能和数据利用的新方法。第一篇,ECHO-k,引入了一种自监督学习原则,用于在测试时获取信息性模态,旨在降低成本并提高下游任务未知时的效率。第二篇,REPA-G,提出了一个使用表示对齐特征的扩散模型测试时条件框架,在无需额外训练的情况下提供对图像生成更精确的控制。
-
FUSEye框架以最少的训练增强鱼眼相机物体检测
研究人员开发了FUSEye,一个旨在提高物体检测模型在鱼眼相机图像上性能的新框架。鱼眼相机常用于移动机器人,由于径向畸变和物体压缩而带来挑战,标准检测器难以处理。FUSEye通过采用GridViews(用于扩大边界区域)、Z-Adapters(用于特征校正)和AgreeFusion(用于跨视图证据促进)等技术,使用极少的附加参数来增强现有的COCO预训练检测器(如YOLO26-x)。这种方法显著提高了在WoodScape等基准测试上的…
-
新代理平台Coco助力ML加速器的软硬件协同设计
研究人员开发了Coco,一个代理平台,旨在协助机器学习加速器的软硬件协同设计的复杂过程。该系统通过将代理程序置于基于SQL的模拟扫描数据存储中进行推理,而不是依赖预先训练的LLM知识,来解决关于不存在系统的推理挑战。Coco利用一个具有类型化API的工具库和自动化重复分析工作流(如iso-execution分析)的代理程序,以加速协同设计生命周期并更有效地获得洞察。
-
视觉 Transformer 显示出具有有限空间范围的涌现式物体绑定能力
研究人员发现视觉 Transformer (ViTs) 表现出一种涌现式的“物体绑定”能力,使它们能够辨别不同的图像块是否属于同一个物体。然而,这种能力在空间上是有限的,随着图像块之间距离的增加,绑定信号会显著减弱。这种有限的空间范围及其相关的基线在各种物体大小、ADE20K 和 COCO 等数据集以及 DINO 和 CLIP 等不同的模型骨干网络中都保持一致,这表明它是所学表征的一种内在属性。
-
无监督MoSA框架从运动数据中学习物体分割
研究人员开发了基于运动的万物分割(MoSA)框架,这是一个无监督框架,旨在克服像Segment Anything Model(SAM)这样的模型对海量手动标注的依赖。MoSA利用未标记的视频从运动中学习物体概念,通过生成运动伪标签、使用对比学习训练感知分组模型(PGM)以及将这些知识转移到用于图像分割的提示引导架构等阶段进行。在COCO和ADE20K等基准测试上的评估表明,MoSA的性能显著优于其他无监督方法,并达到了与监督式SAM相…
-
GroundAnything模型通过并行解码实现最先进的视觉定位
研究人员推出GroundAnything,一个拥有40亿参数的、用于精确视觉定位的基础模型。该模型采用分块去噪(blockwise denoising)的并行解码方法,与传统的自回归方法形成对比,从而实现更快的处理速度。GroundAnything在30个定位基准测试中取得了最先进的性能,超越了同等规模的模型,并与GPT-6 Astra等更大模型展现出有竞争力的结果。该模型还通过优化的解码策略实现了显著的速度提升,使其适用于实时应用。
-
VisionHOPE:发布新的视觉骨干模型及预训练权重
一篇新的研究论文介绍VisionHOPE,一个被设计为自修改学习系统的视觉骨干模型。该论文提供了VisionHOPE不同尺寸(T/S/B)检查点的官方预训练权重。这些检查点可用于ImageNet-1K分类、COCO目标检测和实例分割以及ADE20K语义分割等任务。用户可以使用Hugging Face CLI下载单个或所有检查点。
-
新方法 PixelDense 和 Persistence Forcing 提升扩散模型性能
研究人员开发了两种新颖的技术来增强像素空间扩散模型。PixelDense 通过分别对齐语义和几何特征来改进训练,从而在图像重建和编辑等任务上获得更好的性能。Persistence Forcing (PerF) 利用扩散 Transformer 中的特征专业化,为编码全局结构与局部细节的特征分配不同的细化预算,从而提高了 ImageNet 上的图像生成质量。
-
Gated Token Recurrence 为密集预测提供高效视觉骨干网络
研究人员开发了 Gated Token Recurrence (GTR),这是一种新颖的循环视觉骨干网络,专为高效的密集预测任务而设计。与自注意力模型不同,GTR 避免了全局 softmax 注意力的二次计算成本,使其适用于更高的图像分辨率。该模型在 COCO 等基准测试中取得了强劲的性能,并且在 RTX 4090 和 DRIVE AGX Thor 等硬件上具有低延迟,展示了其在高效边缘部署方面的潜力。
-
Ultralytics YOLO Evolution: From YOLOv5 to YOLO27 Detailed in New Paper
一篇全面的论文回顾了 Ultralytics 的 YOLO 物体检测模型的演变,详细介绍了从 YOLOv5 到最新的 YOLO27 的进步。YOLO27 引入了双架构策略,其中紧凑型版本使用简化的 CNN,而大型版本则采用 Transformer 解码器进行无 NMS 检测。该论文涵盖了架构变更、在 COCO 上的基准测试结果以及跨各行业的部署考量,同时还讨论了 YOLO 系统的未来挑战和方向。
-
新方法验证多模态大语言模型中的物体声明
研究人员开发了一种名为语义空间一致性验证(SSAV)的新型无训练方法,以解决多模态大语言模型中的物体幻觉问题。该技术通过评估物体声明在不同查询下的稳定性及其在图像区域内的持续定位来验证这些声明。SSAV结合了语义支持估计和查询诱导区域验证(QIRV),以降低对措辞的敏感性并识别不可靠的物体提及。实验表明,SSAV能有效减轻幻觉,在COCO、A-OKVQA和GQA等基准测试中提高了准确性,同时在应用于LLaVA-1.5-7B等模型时降低…
-
新的Relation-Orbit方法增强了VLM空间声明的验证能力
研究人员开发了一种名为Relation-Orbit的新方法,用于提高视觉语言模型(VLM)在验证涉及空间关系(如左右区分)的声明时的准确性。该技术聚合了从水平反射等干预中获得的似然度量,以创建更强大的验证信号。在VSR和GQA等数据集上,使用包括LLaVA-1.5在内的各种冻结VLM进行的评估表明,Relation-Orbit在受控风险水平下的覆盖率方面优于现有基线。
-
自适应控制器优化扩散模型,实现更快、更高质量的图像生成
研究人员开发了一种用于扩散模型的自适应控制器,该控制器根据文本提示的复杂性动态调整去噪步数。该方法旨在通过优化推理时间来提高文本到图像生成的效率,而无需额外的模型训练。在 COCO 和 DiffusionDB 数据集上的实验表明,自适应方法在保持视觉保真度的同时减少了生成时间,为基于扩散的文本到图像模型提供了一种更有效的解决方案。
-
新的CTOAC方法改进了视觉状态空间对偶模型的低比特量化
研究人员开发了一种新的后训练量化(PTQ)方法,称为通道感知、Token平衡、输出感知裁剪(CTOAC),以解决视觉状态空间对偶(VSSD)模型中的低比特量化挑战。该研究确定激活量化是关键瓶颈,并提出CTOAC学习每输入通道的裁剪边界,从而最小化重建损失。该方法在各种VSSD模型尺寸的激进精度设置下成功保持了ImageNet-1K的准确性并提高了鲁棒性,同时在COCO和ADE20K数据集上的目标检测和分割任务中也保持了性能。在RTX …
-
新研究质疑注意力引导掩码在对象发现中的有效性
一篇新的研究论文质疑了注意力引导掩码(AGM)在以对象为中心的学习中的有效性。以对象为中心的学习是一种旨在无需人工监督即可将图像分解为对象的方法。研究发现,使用注意力机制来引导图像块掩码的AGM,其效果并不总是优于随机掩码(RM)等更简单的方法。虽然AGM在某些数据集的背景分割方面有所改进,但前景对象发现的准确性却保持相当或有所下降。研究人员建议同行在探索注意力语义以通过掩码解码改进以对象为中心的学习时要谨慎。
-
新的人为中心模型改进了手部-物体交互检测
研究人员开发了一种新颖的手部-物体交互检测方法,该方法侧重于以人为中心的表述,而非传统的手部中心方法。这种新方法使用单个查询来预测一个人的全面信息集,包括其边界框、身体姿态、手部状态和交互目标。该系统采用部件感知可变形注意力机制和手部到查询的关系矩阵来有效推理这些复杂交互,在一个单一框架内统一了检测、姿态估计和手部分析。
-
研究人员从头开始在单GPU上训练2.1亿参数文本到图像DiT模型
一位研究人员从头开始训练了一个拥有2.1亿参数的文本到图像扩散Transformer模型,并在单台GPU上花费了3.5天完成。该实验的关键发现包括:学习到的空注意力槽成为交叉注意力质量的主要汇聚点;流匹配损失作为健康信号而非直接质量指标;训练时间步长偏移比简单地将训练步数加倍更具影响力。
-
新AI框架通过可信置信度分数增强可解释目标检测
研究人员开发了一种新颖的可解释目标检测框架,结合了Kolmogorov-Arnold网络和视觉语言基础模型。该方法旨在通过提高其置信度分数可靠性的透明度来增强AI系统的可信度,尤其是在具有挑战性的视觉条件下。该系统利用Kolmogorov-Arnold网络作为可解释的代理模型,来模拟YOLOv10检测的可信度,并可视化各种特征的影响。此外,BLIP基础模型生成场景描述,创建了一个轻量级多模态接口。在COCO和巴斯大学校园图像上的实验表…
-
新框架利用预训练检测器的稳定-塑性不对称性进行增量目标检测
研究人员开发了一个新的增量目标检测框架,该框架利用了预训练的DETR类检测器中存在的稳定-塑性不对称性。该方法冻结了定位头以保持几何稳定性,同时调整了Transformer表示和分类头以实现塑性,尤其是在跨域场景中。该方法还结合了伪特征回放以减轻先前学习类别的遗忘,并使用两阶段一致蒸馏来对齐表示。在COCO、VOC和TT100K数据集上的实验表明,该方法在保留旧类别和适应新类别之间取得了平衡,达到了最先进的性能。