PulseAugur
实时 09:16:33
English(EN) Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

新的 ConfBench 基准评估 VLM 在文档提取中的置信度

一个名为 ConfBench 的新基准已被开发出来,用于评估视觉语言模型(VLM)在文档提取任务中置信度得分的可靠性。该基准包含降级的文档样本,揭示了虽然模型能力是置信度准确性的关键因素,但特定的 VLM 系列和模态(OCR+图像)也起着重要作用。事后校正方法可以改善用于路由提取的校准,并且具有一阶聚合的对数概率似乎是最有效的置信度估计方法。 AI

影响 该基准将通过改进视觉语言模型的置信度估计,帮助开发人员构建更可靠的文档处理人工智能系统。

排序理由 该集群包含一篇介绍新人工智能模型评估基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 ConfBench 基准评估 VLM 在文档提取中的置信度

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Priyashree Roy, Sujitha Martin, Mohammad Rostami, Spencer Romo, Renhao Xue, Bob Strahan, Diego A. Socolinsky, Boyi Xie, Md Mofijul Islam ·

    Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

    arXiv:2608.01792v1 Announce Type: cross Abstract: Intelligent document processing (IDP) with vision-language models (VLMs) hinges on confidence scores trustworthy enough to route extractions between automation and human review. Existing document benchmarks are dominated by clean,…