研究人员推出ConceptFormer,一个旨在增强视觉文档检索的新型框架。该方法学习自适应的潜在概念,以更好地将查询与相关文档对齐,即使证据分散在文本、布局和视觉结构中。与依赖文本描述或原始视觉注释的先前方法不同,ConceptFormer使用查询条件潜在概念作为中间表示。实验表明,ConceptFormer显著提高了检索准确性,在NDCG@10方面比现有的基于视觉和OCR的基线取得了实质性进展。 AI
影响 该框架可以提高多模态检索系统的准确性,改善用户在复杂文档中查找相关信息的方式。
排序理由 该集群描述了一篇详细介绍用于视觉文档检索的新框架的研究论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →