PulseAugur
实时 05:56:28
English(EN) Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

新的智能体框架解决了多页文档视觉问答问题

研究人员推出 Doc-V*,一个无 OCR 的智能体框架,专为多页文档视觉问答而设计。该系统采用粗粒度到细粒度的交互式方法,解决了处理长而视觉密集型文档的挑战。Doc-V* 首先进行广泛概述,然后使用语义检索和定向页面获取来收集证据,这些证据随后在结构化工作内存中进行聚合以进行推理。与检索增强生成基线相比,该框架在各种基准测试中的域外性能提高了高达 47.9%。 AI

影响 该框架可以改进 AI 系统处理和推理长文档的方式,影响法律科技、研究分析和文档管理等领域。

排序理由 该集群描述了一篇详细介绍特定 AI 任务新颖框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的智能体框架解决了多页文档视觉问答问题

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan, Wei Chen, Xiang Bai ·

    Doc-V*: 多页文档视觉问答的粗粒度到细粒度交互式视觉推理

    arXiv:2604.13731v2 Announce Type: replace Abstract: Multi-page Document Visual Question Answering requires reasoning over semantics, layouts, and visual elements in long, visually dense documents. Existing OCR-free methods face a trade-off between capacity and precision: end-to-e…