研究人员开发了一种名为拒绝校准的组相对策略优化(RC-GRPO)的新型强化学习策略,以提高多模态大语言模型(MLLM)正确识别文本中描述的对象是否不存在的能力。目前的MLLM在这一点上常常遇到困难,由于缺乏负面训练样本而产生幻觉输出。RC-GRPO旨在增强拒绝能力,同时不牺牲模型在正面样本上的核心对象定位准确性。在三个基准上的实验表明,RC-GRPO在准确性和可靠性之间取得了更好的平衡。 AI
影响 通过提高MLLM处理负面案例的能力,增强了其可靠性,有望减少视觉基础任务中的幻觉。
排序理由 该集群描述了一篇详细介绍改进MLLM能力的新颖方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Generalized Referring Expression Comprehension
- MLLMs
- RC-GRPO
- Refusal-Calibrated Group Relative Policy Optimization
- reinforcement learning
- supervised fine-tuning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →