研究人员开发了VLD-RAG,一个新颖的代理式框架,专为长篇、富含视觉信息文档的检索增强生成而设计。该系统构建了一个多模态索引,保留了页面布局,并结合了文本和视觉信号。通过采用结合关键词和语义搜索的混合检索策略,VLD-RAG能够识别相关的证据页面,并利用协调的代理工作流进行证据收集、引用验证和检索请求的迭代优化。在LongDocURL和MMLongBench-Doc等基准测试上的评估表明,与现有的基于视觉的方法相比,VLD-RAG在证据检索和问答准确性方面均表现出优越性。 AI
影响 该框架可以显著改善AI系统处理和回答包含文本和视觉信息的复杂、多页文档中问题的能力。
排序理由 这是一篇详细介绍用于文档分析的新AI框架的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →