CiteVQA
PulseAugur coverage of CiteVQA — every cluster mentioning CiteVQA across labs, papers, and developer communities, ranked by signal.
- 2026-05-13 research_milestone Introduction of the CiteVQA benchmark for evaluating evidence attribution in multimodal large language models. 来源
1 天有情绪数据
-
新的CiteVQA基准测试揭示了LLM中的“归因幻觉”
引入了一个名为CiteVQA的新基准,用于评估多模态大语言模型(MLLM)的证据归因能力。当前的文档问答(Doc-VQA)评估仅评估最终答案,忽略了模型可能引用错误来源的情况。CiteVQA要求模型在答案的同时提供元素级边界框引用,并评估两者准确性。该基准包含711个PDF文件中的1897个问题,涵盖各种领域和语言,并有一个用于生成地面真实引用(ground-truth citations)的自动化流程。测试揭示了显著的“归因幻觉”,…
-
新方法通过引用文本而非坐标来改进视觉文档理解
研究人员开发了一种新的视觉文档理解方法,该方法无需基于坐标的区域标签。通过比较坐标接口和基于文本的引用检索管道,他们发现后者显著提高了证据召回率,并降低了多个视觉语言模型中的幻觉率。这种方法使用 GRPO 配方来训练模型,使其能够引用更好的证据,而无需昂贵的区域级监督,并在 8B 主干模型上展示了严格归因准确性的提高。
-
研究发现GPT-4等AI模型未能准确引用来源
CiteVQA的一项新研究表明,包括GPT-4在内的领先AI模型经常提供正确答案,但在可靠引用其来源方面存在困难。这种无法准确归因信息的能力引发了对AI生成内容的可靠性和可验证性的担忧。该研究突显了当前AI能力的一个关键差距,尤其是在需要事实准确性和来源透明度的应用中。
-
AI模型出现引文幻觉,新基准测试揭示
包括GPT和Gemini在内的领先AI模型经常提供正确答案,但引用不存在或不相关的证据。北京大学的研究人员将这种现象称为“引文幻觉”,它在法律和医学等关键领域构成了重大风险。为解决这一问题,开发了一个名为CiteVQA的新基准测试,以系统地评估和识别这些引文错误。
-
新基准CiteVQA揭示LLM中的“归因幻觉”
研究人员推出了CiteVQA,这是一个旨在评估多模态大语言模型(MLLM)将答案准确归因于文档内特定源区域能力的新基准。与仅对最终答案评分的先前评估不同,CiteVQA要求模型在答案旁边提供元素级边界框引用,联合评估两者。该基准包含711个PDF文件中的1897个问题,揭示了一个被称为“归因幻觉”的重大问题,即模型经常提供正确的答案但引用错误的证据,这凸显了当前文档智能系统中存在的关键可靠性差距。