Open-Vocabulary Object Detection
PulseAugur coverage of Open-Vocabulary Object Detection — every cluster mentioning Open-Vocabulary Object Detection across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架通过域适应和类别几何增强开放词汇目标检测
研究人员正在开发新的开放词汇目标检测框架,旨在提高模型在遇到图像域偏移时的性能。PISA 是一种新颖的方法,它使用一种抗损坏特征提取器和特征对齐模块,在没有源数据的情况下适应预训练模型,在损坏的基准测试中取得了最先进的结果。另一种方法是类别几何监督 (CGS),它约束学习到的类别表示以保留视觉或语义上的差异,从而提高样本效率和新类别的插入能力,尤其是在数据稀缺的情况下。此外,还引入了一个名为稀疏标注开放世界目标检测 (SA-OWOD)…
-
新的QATMA框架解决了开放词汇目标检测中的低比特量化挑战
研究人员开发了QATMA,一个新颖的量化感知训练框架,专门用于开放词汇目标检测(OVOD)模型。该方法解决了在极端低比特量化时发生的跨模态和模态内对齐的退化问题,这是先前针对闭词汇检测器的方法未能解决的问题。QATMA采用基于课程的学习策略,逐步量化模型的不同组件,并使用文本锚定蒸馏来保留对齐信息。实验表明,QATMA在低比特条件下显著提高了LVIS和COCO基准测试的性能。
-
新的DG-OVOD协议和PICA方法增强了开放词汇目标检测的鲁棒性
研究人员引入了一个名为领域泛化开放词汇目标检测(DG-OVOD)的新评估协议,用于评估开放词汇目标检测系统在视觉分布变化下的鲁棒性。他们观察到,这种变化会破坏跨模态空间的稳定性,导致新类别的视觉信号偏离其语义锚点。为解决此问题,他们提出了渐进式领域不变跨模态对齐(PICA)方法,该方法使用基于歧义和信号强度的多级课程来优化跨域模态对齐,以实现更稳定和更具泛化能力的开放词汇系统。
-
新ProCal方法增强开放词汇目标检测
研究人员开发了ProCal,一种用于开放词汇目标检测的新颖方法,可在推理时校准分类分数。该方法通过分析预训练的视觉-语言模型(VLMs)区分前景和背景区域的能力来利用它们。ProCal结合了感知定位的前景分数和感知背景的抑制分数,以提高在训练期间未见过的类别的目标定位和分类的准确性。当应用于CLIPSelf ViT-L/14时,ProCal在OV-LVIS数据集上展示了+2.5 APr的显著改进。
-
新的DSAA框架提升了开放词汇模型中的细粒度属性检测能力
研究人员开发了一个名为双阶段属性激活(DSAA)的新框架,以提高开放词汇目标检测模型的细粒度检测能力。当前模型在将颜色和纹理等属性准确地绑定到对象方面存在困难,当类别信号较强时,属性信息常常被边缘化。DSAA通过两个阶段增强属性语义来解决这个问题:属性前缀适配器注入显式的属性先验,而键/值调制器在BERT编码过程中选择性地放大属性token的影响。一个属性感知的对比损失在训练过程中进一步辅助区分,在FG-OVD基准上的实验显示出显著的改进。
-
新的基准和框架推动开放词汇目标检测发展
研究人员推出了新的开放词汇目标检测框架,该领域旨在使AI模型能够识别预定义类别之外的对象。一种方法LV-OSD利用文本和图像提示来指定所需的对象类别,采用具有动态加权模块的双分支检测框架来弥合语义鸿沟。另一项开发COVD解决了在不完全重新训练的情况下持续用新概念更新目标检测模型的挑战,提出了一种有效的注入框架来保留先验知识。此外,还建立了一个名为ODOV的基准,用于在同时发生域和类别偏移的情况下评估模型,并引入了一个利用多模态对齐能力的基线。
-
新方法提升开放词汇目标检测的鲁棒性和自适应能力
研究人员引入了几种新方法来改进开放词汇目标检测,该领域旨在根据人类提示识别任意目标。一种方法 EBOD 将基于提示的检测器与特征匹配模块集成,无需重新训练即可抑制重复出现的假阳性和假阴性。另一种方法 RGSE 在测试时使用进化搜索过程来精炼文本嵌入,以有效地对齐文本和视觉嵌入。此外,FACTOR 利用反事实推理,通过扰动测试图像并分析属性敏感性来使模型适应分布变化,而 DAT 提供了一种轻量级的自监督微调方法来增强用于目标检测的视觉语言模型。