PulseAugur
实时 10:57:54
English(EN) Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

新的RL策略训练MLLM拒绝不存在的对象

研究人员开发了一种名为拒绝校准的组相对策略优化(RC-GRPO)的新型强化学习策略,以提高多模态大语言模型(MLLM)正确识别文本中描述的对象是否不存在的能力。目前的MLLM在这一点上常常遇到困难,由于缺乏负面训练样本而产生幻觉输出。RC-GRPO旨在增强拒绝能力,同时不牺牲模型在正面样本上的核心对象定位准确性。在三个基准上的实验表明,RC-GRPO在准确性和可靠性之间取得了更好的平衡。 AI

影响 通过提高MLLM处理负面案例的能力,增强了其可靠性,有望减少视觉基础任务中的幻觉。

排序理由 该集群描述了一篇详细介绍改进MLLM能力的新颖方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RL策略训练MLLM拒绝不存在的对象

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang ·

    教会MLLMs说“不”:通过拒绝校准的GRPO实现广义指代表达理解

    arXiv:2608.04698v1 Announce Type: cross Abstract: We tackle the challenging yet underexplored task of Generalized Referring Expression Comprehension (GREC), which requires a model to localize the object described by a textual expression when it exists (positive sample) and to ref…