PulseAugur
实时 17:55:15
English(EN) Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

新的OP-HRG方法提高了AI识别物体部件的能力

研究人员开发了一种名为对象-部件分层反思定位(OP-HRG)的新方法,以改进多模态大语言模型(MLLMs)根据语言查询识别物体特定部件的能力。当前模型在部件级定位方面存在困难,因为它们试图一步定位物体及其部件。OP-HRG通过首先识别父对象,然后在该对象内精确定位部件来解决这个问题,并包含一个自我检查机制。使用此方法训练的40亿参数模型在各种部件级定位数据集上表现优于更大的模型和SAM3,并且在推理分割任务中也显示出有效性。 AI

影响 增强了AI的细粒度视觉理解能力,有望改进需要精确识别物体部件的应用。

排序理由 这是一篇详细介绍AI模型中视觉定位新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的OP-HRG方法提高了AI识别物体部件的能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas ·

    基于强化学习的推理引导式部件级视觉定位

    arXiv:2607.15374v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) ground whole objects well from free-form language queries, but they struggle when the query names a part rather than the object. We trace this to a missing object-part hierarchy, since parts …