PulseAugur
中
实时 10:01:39
实体 CiteVQA

CiteVQA

PulseAugur coverage of CiteVQA — every cluster mentioning CiteVQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
时间线
  1. 2026-05-13 research_milestone Introduction of the CiteVQA benchmark for evaluating evidence attribution in multimodal large language models. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_289514 ·

    新的CiteVQA基准测试揭示了LLM中的“归因幻觉”

    引入了一个名为CiteVQA的新基准,用于评估多模态大语言模型(MLLM)的证据归因能力。当前的文档问答(Doc-VQA)评估仅评估最终答案,忽略了模型可能引用错误来源的情况。CiteVQA要求模型在答案的同时提供元素级边界框引用,并评估两者准确性。该基准包含711个PDF文件中的1897个问题,涵盖各种领域和语言,并有一个用于生成地面真实引用(ground-truth citations)的自动化流程。测试揭示了显著的“归因幻觉”,…

  2. TOOL · CL_166827 ·

    新方法通过引用文本而非坐标来改进视觉文档理解

    研究人员开发了一种新的视觉文档理解方法,该方法无需基于坐标的区域标签。通过比较坐标接口和基于文本的引用检索管道,他们发现后者显著提高了证据召回率,并降低了多个视觉语言模型中的幻觉率。这种方法使用 GRPO 配方来训练模型,使其能够引用更好的证据,而无需昂贵的区域级监督,并在 8B 主干模型上展示了严格归因准确性的提高。

  3. TOOL · CL_49038 ·

    研究发现GPT-4等AI模型未能准确引用来源

    CiteVQA的一项新研究表明,包括GPT-4在内的领先AI模型经常提供正确答案,但在可靠引用其来源方面存在困难。这种无法准确归因信息的能力引发了对AI生成内容的可靠性和可验证性的担忧。该研究突显了当前AI能力的一个关键差距,尤其是在需要事实准确性和来源透明度的应用中。

  4. TOOL · CL_49036 ·

    AI模型出现引文幻觉,新基准测试揭示

    包括GPT和Gemini在内的领先AI模型经常提供正确答案,但引用不存在或不相关的证据。北京大学的研究人员将这种现象称为“引文幻觉”,它在法律和医学等关键领域构成了重大风险。为解决这一问题,开发了一个名为CiteVQA的新基准测试,以系统地评估和识别这些引文错误。

  5. TOOL · CL_30596 ·

    新基准CiteVQA揭示LLM中的“归因幻觉”

    研究人员推出了CiteVQA,这是一个旨在评估多模态大语言模型(MLLM)将答案准确归因于文档内特定源区域能力的新基准。与仅对最终答案评分的先前评估不同,CiteVQA要求模型在答案旁边提供元素级边界框引用,联合评估两者。该基准包含711个PDF文件中的1897个问题,揭示了一个被称为“归因幻觉”的重大问题,即模型经常提供正确的答案但引用错误的证据,这凸显了当前文档智能系统中存在的关键可靠性差距。