研究人员开发了DRAgent,一个利用多模态大语言模型(MLLM)的指代表达分割(RES)新框架。与直接预测坐标的先前方法不同,DRAgent采用判别式推理方法。它首先识别一组潜在的物体候选,然后使用MLLM从这些候选中准确选择目标物体。然后,这个选定的物体用于指导分割模型生成精确的像素级掩码。该框架还包括一个用于微调MLLM推理能力的数据管道,在标准的RES数据集上取得了有竞争力的结果。 AI
影响 这种判别式推理方法可以提高视觉-语言任务中物体定位的准确性。
排序理由 该集群描述了一篇详细介绍计算机视觉任务新框架的学术论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Hugging Face
- multimodal large language models
- RefCOCO
- RefCOCOg
- Referring Expression Segmentation
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →