Grounding DINO
PulseAugur coverage of Grounding DINO — every cluster mentioning Grounding DINO across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
WALDO系统使用V-JEPA 2.1特征进行单次目标检测
研究人员推出WALDO,一种专为杂乱场景设计的新型单次目标检测系统。WALDO利用V-JEPA 2.1世界模型的冻结特征,仅需340万个可训练参数。这种方法使其能够在骨干网络上无需反向传播即可预测目标定位和存在。该系统合成训练数据,以克服示例条件监督的稀缺性,在未见过的场景中展示了0.461的目录AP@50,优于Grounding DINO基线。
-
新框架增强城市交通数据集的隐私保护
研究人员开发了一个自动匿名化城市交通数据集的新框架,专门解决马来西亚吉隆坡的挑战。该系统集成了Grounding DINO(一种视觉语言Transformer)和一个空间车辆包含引擎,以准确识别和模糊人脸、头部和车牌,同时最大限度地减少背景元素的误报。这种方法旨在为下游视觉任务保留场景上下文,同时增强隐私意识的数据集策展。
-
新框架通过域适应和类别几何增强开放词汇目标检测
研究人员正在开发新的开放词汇目标检测框架,旨在提高模型在遇到图像域偏移时的性能。PISA 是一种新颖的方法,它使用一种抗损坏特征提取器和特征对齐模块,在没有源数据的情况下适应预训练模型,在损坏的基准测试中取得了最先进的结果。另一种方法是类别几何监督 (CGS),它约束学习到的类别表示以保留视觉或语义上的差异,从而提高样本效率和新类别的插入能力,尤其是在数据稀缺的情况下。此外,还引入了一个名为稀疏标注开放世界目标检测 (SA-OWOD)…
-
新的 GCRL 方法使用动态对象掩码进行视觉目标表示
研究人员开发了一种新颖的目标条件强化学习(GCRL)方法,该方法利用动态对象掩码作为目标表示。该方法绕过了对特权状态或位置信息的需要,而这些信息在实际机器人应用中通常不可用。通过使用基于图像的目标检测器,该系统可以为导航和操作任务生成空间目标,展示了广泛的适用性和强大的泛化能力。该方法在稳定性和样本效率方面显示出显著的改进,在机器人手臂上实现了高成功率,并在模拟中实现了更快的学习。
-
AI科学家将“世界模型”定义为动作条件化,对具身AI至关重要
领先的AI科学家、Visionary Future创始人张磊认为,当前AI行业“世界模型”的兴起是由具身AI中模仿学习的局限性所驱动的。他强调,真正的世界模型必须是动作条件化的,这意味着它能够根据智能体采取的特定动作来预测环境变化。这种能力对于使机器人能够通过模拟试错来学习至关重要,从而降低了现实世界实验的高成本和风险。张磊指出,尽管中国在机器人硬件方面取得了令人瞩目的进步,但真正的瓶颈在于开发能够进行真正因果推理和适应性的更复杂的A…
-
新的ABRA方法可跨领域迁移目标检测知识
研究人员推出了一种名为ABRA(Aligned Basis Relocation for Adaptation)的新颖方法,旨在将知识从已标记的源域迁移到缺乏标注数据的目标域,以实现开放词汇目标检测。该技术解决了在领域迁移时,尤其是在特定类别缺乏标注样本或没有标注样本的情况下,Grounding DINO等模型出现的显著性能下降问题。ABRA将适应性问题构建为预训练检测器权重空间内的几何传输问题,有效地对齐领域专家以迁移特定类别的检测知识。
-
GeoAI教程详解使用U-Net、DINO、SAM和Mask R-CNN构建足迹提取
本教程详细介绍了使用多种深度学习模型从航空影像中提取建筑足迹的GeoAI工作流程。内容涵盖地理空间环境的设置、使用带有ResNet-34编码器的U-Net模型进行训练以及执行推理。该过程还包括将分割掩码转换为多边形、评估性能指标,以及探索Grounding DINO和SAM的零样本分割,并与预训练的Mask R-CNN模型进行结果比较。
-
AI物体检测器指示物体存在而非可见性,用于杂乱场景 · 跟踪2个来源
一项新的研究论文揭示,广泛用于语言接地和主动感知等任务的开放词汇物体检测器,通常指示物体存在而非其可见性。即使物体被严重遮挡,这些检测器也会保持高置信度,有时甚至随着杂乱程度的增加而提高置信度。这种校准不当会导致评估不准确和门控机制存在缺陷,因为置信度分数与实际可见性不相关。该研究测试了多种检测器、物体类别和遮挡类型下的这种现象,并发布了一个受控基准来解决检测器校准不当和物体幻觉问题。
-
用户研究发现改进的机器人交互系统可被用户感知
一项新发表在arXiv上的研究探讨了用户在与模态多个人机交互系统交互时所经历的感知差异。该研究将使用Whisper、Florence-2和Llama 3.1的基线系统与改进配置进行了比较,改进配置采用了Grounding DINO + SAM和Qwen 3.5 9B。用户反馈表明,用户显著偏爱改进后的系统,认为其速度、可靠性和整体能力评分更高,这凸显了用户为中心的评估与技术指标同等重要。
-
新AI框架将放射科医生语音转换为MRI肿瘤分割
研究人员开发了LoGSAM,一个用于脑部MRI扫描中脑肿瘤参数高效分割的新框架。该系统将放射科医生的口述转化为文本提示,以指导基础模型进行定位和分割。通过利用Whisper ASR、Grounding DINO和MedSAM等预训练模型,并进行最少的参数更新,LoGSAM在BRISC 2025数据集上取得了80.32%的Dice分数,接近完全微调模型的性能,同时使用的参数却少得多。该流程还展示了从德语口述中提取肿瘤特异性信息的高准确性。
-
HKVLM 模型通过分离定位和语言来改进视觉推理
研究人员开发了 HKVLM,一种新颖的视觉推理方法,它将定位与语言生成分离开来。该模型利用一个冻结的语言对齐检测器和一个冻结的语言模型,通过一个轻量级的对齐钩连接。该钩通过对比检索和二分匹配将语言查询绑定到区域建议,旨在提高视觉问答和目标检测任务的忠实度。该系统专为小数据设置而设计,并包含一个忠实度否决机制,以防止命名不支持的对象,从而显著降低幻觉率。
-
新框架NegAS提升了视觉语言模型中分布外目标的检测能力
研究人员推出了一种新颖的框架NegAS,旨在增强视觉语言模型(VLMs)中分布外(OOD)目标的检测能力。NegAS解决了两个关键挑战:改进注意力机制以更好地识别潜在的OOD区域,以及开发与VLM概率输出兼容的评分函数。该框架利用负标签来指导注意力,并使用基于sigmoid的评分函数来区分分布内和分布外实例,在COCO和OpenImages等数据集上显著提高了OOD检测性能,同时保持了对分布内目标的准确性。
-
新型3D检测器CT-3GDINO增强腹部CT扫描中的器官定位
研究人员开发了CT-3GDINO,这是一种新颖的3D对象检测模型,专为腹部CT扫描中的器官定位而设计。该轻量级模型采用了类似Grounding-DINO的架构,使用冻结的伪文本类别令牌而非传统的文本编码器。CT-3GDINO集成了Swin3D骨干网络、双向特征增强和跨模态解码器,以预测肝脏、脾脏和肾脏等器官的边界框。在193个CT体积上进行评估,该模型取得了具有竞争力的mAP分数,在粗略定位方面表现强劲,同时指出了精确边界框对齐方面的改进空间。
-
AI流水线自动标注图像中的未知物体
研究人员开发了一个自动化流水线,用于标注图像中现有开放词汇模型无法识别的物体。该系统旨在减少为训练物体检测模型创建边界框的繁琐手动工作。通过采用SAM3和Grounding DINO等策略,该流水线生成候选标注,用户可以快速接受或拒绝,从而显著加快数据标注过程。
-
Visionary Future 开发以物体为中心的潜在世界模型
一家总部位于深圳的 AI 团队 Visionary Future 正在开发一个
-
新的零样本追踪系统在多动物研究中表现出色
研究人员开发了一种新的零样本多动物追踪系统,该系统利用视觉基础模型,特别是将SAM2MOT与Grounding DINO和Segment Anything Model 2相结合。该方法通过在无需重新训练的情况下展示出跨不同物种和环境的强大泛化能力,在包括Chimp-Act和Bird Flock Tracking在内的多个数据集上取得了最先进的结果。研究还探讨了较新的SAM3模型在此特定应用中的局限性。
-
新方法提升开放词汇目标检测的鲁棒性和自适应能力
研究人员引入了几种新方法来改进开放词汇目标检测,该领域旨在根据人类提示识别任意目标。一种方法 EBOD 将基于提示的检测器与特征匹配模块集成,无需重新训练即可抑制重复出现的假阳性和假阴性。另一种方法 RGSE 在测试时使用进化搜索过程来精炼文本嵌入,以有效地对齐文本和视觉嵌入。此外,FACTOR 利用反事实推理,通过扰动测试图像并分析属性敏感性来使模型适应分布变化,而 DAT 提供了一种轻量级的自监督微调方法来增强用于目标检测的视觉语言模型。