PulseAugur
实时 05:49:39
English(EN) VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

新的VLD-RAG框架增强了AI处理长篇、视觉文档的能力

研究人员开发了VLD-RAG,一个新颖的代理式框架,专为长篇、富含视觉信息文档的检索增强生成而设计。该系统构建了一个多模态索引,保留了页面布局,并结合了文本和视觉信号。通过采用结合关键词和语义搜索的混合检索策略,VLD-RAG能够识别相关的证据页面,并利用协调的代理工作流进行证据收集、引用验证和检索请求的迭代优化。在LongDocURL和MMLongBench-Doc等基准测试上的评估表明,与现有的基于视觉的方法相比,VLD-RAG在证据检索和问答准确性方面均表现出优越性。 AI

影响 该框架可以显著改善AI系统处理和回答包含文本和视觉信息的复杂、多页文档中问题的能力。

排序理由 这是一篇详细介绍用于文档分析的新AI框架的研究论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的VLD-RAG框架增强了AI处理长篇、视觉文档的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Seonok Kim ·

    VLD-RAG:用于长篇、富含视觉信息的多页文档的代理式视觉-语言检索增强生成

    arXiv:2607.24748v1 Announce Type: cross Abstract: Visually-rich documents such as reports, slides, and manuals often distribute the evidence needed to answer a question across multiple pages, mixing text with layout cues, tables, charts, and figures. This work studies multimodal …