GroundingDINO
PulseAugur coverage of GroundingDINO — every cluster mentioning GroundingDINO across labs, papers, and developer communities, ranked by signal.
-
研究发现:开放词汇目标检测置信度分数存在偏差
一篇新的arXiv论文揭示,开放词汇目标检测模型中的置信度分数并不可靠,它们将物体尺度和语义特异性与真实的检测信号混淆。研究人员证明,由于尺度偏差,大物体获得的得分系统性地被夸大,而通用查询则因语义偏差而被抑制。这些问题源于CLIP等基础模型的图像级预训练,无法通过简单的阈值调整完全解决。虽然温度缩放可以提高小目标的召回率,但会牺牲精度,这表明在将这些模型应用于区域级检测任务时存在根本性限制。
-
FlowOVD论文介绍利用生成式潜在流实现开放词汇检测
研究人员推出了一种新颖的开放词汇目标检测方法FlowOVD,将该问题从判别式重构为生成式。该方法利用潜在空间中的连续传输过程,通过修正流将静态查询转换为文本引导的查询。FlowOVD通过实现更具表现力的语义对齐且无需额外训练数据,在LVIS等具有挑战性的数据集上展示了性能的提升。
-
新基准MM-Conv旨在实现3D对话中的AI基础
研究人员推出了MM-Conv,这是一个旨在改进AI系统在对话中理解和定位动态3D环境中语言的新基准。该基准利用了以自我为中心的VR交互数据,捕获了6.7小时的同步语音、运动、注视和3D场景几何信息。提出了一种新颖的两阶段基础流程,该流程首先解决对话歧义,然后执行视觉定位,从而带来显著的性能提升。
-
LLMs enhance video anomaly detection with reasoning and spatial grounding
研究人员开发了VANGUARD,一个将视频异常检测与多模态大型语言模型相结合的新框架。该系统不仅能识别异常,还能提供可解释的思维链推理和异常事件的精确空间定位。VANGUARD采用分阶段训练方法和师生标注流程,在UCF-Crime等基准测试中取得了优异的性能,并展示了跨领域泛化能力。