研究人员开发了一种名为对象-部件分层反思定位(OP-HRG)的新方法,以改进多模态大语言模型(MLLMs)根据语言查询识别物体特定部件的能力。当前模型在部件级定位方面存在困难,因为它们试图一步定位物体及其部件。OP-HRG通过首先识别父对象,然后在该对象内精确定位部件来解决这个问题,并包含一个自我检查机制。使用此方法训练的40亿参数模型在各种部件级定位数据集上表现优于更大的模型和SAM3,并且在推理分割任务中也显示出有效性。 AI
影响 增强了AI的细粒度视觉理解能力,有望改进需要精确识别物体部件的应用。
排序理由 这是一篇详细介绍AI模型中视觉定位新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- InstructPart
- Kazi Sajeed Mehrab
- MLLMs
- multimodal large language models
- Object-Part Hierarchical Reflective Grounding
- OP-HRG
- PartImageNet
- PascalPart
- SAM3
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →