Referring Expression Comprehension
PulseAugur coverage of Referring Expression Comprehension — every cluster mentioning Referring Expression Comprehension across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新基准RefBench-PRO评估MLLM的感知和推理能力
研究人员推出了RefBench-PRO,这是一个旨在评估多模态大型语言模型(MLLM)在指代表达理解(REC)方面的感知和推理能力的新基准。该基准将REC分解为感知和推理维度,涵盖六项具有挑战性的任务,解决了现有基准主要关注感知能力的局限性。还开发了一个新颖的自动化数据生成管道和一个名为Ref-R1的基于强化学习的学习方案,以提高定位精度并为REC提供更强的基线。
-
新的SVCR框架增强了弱监督指代表达理解
研究人员开发了一个名为结构化视觉组合表示(SVCR)的新框架,以改进弱监督设置下的指代表达理解(REC)。该框架显式地建模单个对象嵌入和成对关系嵌入,创建结构化视觉表示。然后,组合对齐机制将这些视觉表示与其对应的文本嵌入进行匹配,从而在弱监督下实现更准确的视觉-文本匹配。在RefCOCO等标准数据集上的实验表明,SVCR取得了最先进的性能,突显了显式结构化视觉表示对WREC的好处。
-
新的 MedGrounder 模型推进了通用医学短语定位
研究人员推出了一种新颖的通用医学短语定位 (GMPG) 模型 MedGrounder。这种新方法通过将句子映射到零个、一个或多个图像区域来解决现有系统的局限性,能够处理多区域发现和诸如否定等无法定位的短语。MedGrounder 采用两阶段训练过程,首先在句子-解剖框对齐上进行训练,然后在使用句子-人工标注框数据集进行微调。在 PadChest-GR 和 MS-CXR 数据集上的实验表明,它具有强大的零样本迁移能力,并且在复杂短语方面…