研究人员推出 Doc-V*,一个无 OCR 的智能体框架,专为多页文档视觉问答而设计。该系统采用粗粒度到细粒度的交互式方法,解决了处理长而视觉密集型文档的挑战。Doc-V* 首先进行广泛概述,然后使用语义检索和定向页面获取来收集证据,这些证据随后在结构化工作内存中进行聚合以进行推理。与检索增强生成基线相比,该框架在各种基准测试中的域外性能提高了高达 47.9%。 AI
影响 该框架可以改进 AI 系统处理和推理长文档的方式,影响法律科技、研究分析和文档管理等领域。
排序理由 该集群描述了一篇详细介绍特定 AI 任务新颖框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- DagsHub
- Doc-V*
- Group Relative Policy Optimization
- Hugging Face
- optical character recognition
- retrieval-augmented generation
- visual question answering
- Yuanlei Zheng
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →