PulseAugur
实时 11:39:56
English(EN) Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs

新的多语言数据集和模型推动视觉对象关联

研究人员开发了一种新的指代表达理解(REC)方法,该方法解决了当前研究主要以英语为中心的特点。他们通过翻译和增强现有的英语REC基准,构建了一个涵盖10种语言的多语言数据集。此外,他们引入了一种高效的神经网络架构,该架构利用多语言SigLIP2编码器和基于注意力机制来生成和优化用于对象定位的空间锚点。该系统在标准基准上表现出竞争力,并在各种语言中展现出一致的能力,突显了高效多语言视觉关联的可行性。 AI

影响 通过克服对象定位中以英语为中心的限制,实现了更具全球适用性的视觉关联系统。

排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了一个用于多语言指代表达理解的新数据集和模型架构。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的多语言数据集和模型推动视觉对象关联

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Francisco Nogueira, Alexandre Bernardino, Bruno Martins ·

    视觉输入中指代目标对象的多种语言表达的理解

    arXiv:2511.11427v2 Announce Type: replace Abstract: Referring Expression Comprehension (REC) requires models to localize objects in images based on different types of natural language descriptions. Even with significant progress, research on the area remains predominantly English…