研究人员开发了新的多模态文档检索框架,以提高对视觉丰富的文档进行问答的准确性。MIDR将多模态推理转移到索引时间,在准确性和效率方面比ColQwen2.5等现有方法取得了显著的进步。Doc-REFRAG通过压缩视觉标记并选择性地扩展相关标记,解决了现实世界多图像场景中的挑战,在多个基准测试中表现优于基线,且延迟更低。 AI
影响 多模态文档检索的这些进步可以显著提高处理复杂、视觉丰富的信息的AI系统的准确性和效率。
排序理由 该集群包含两篇详细介绍多模态文档检索新方法的论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DocLongRAG
- Doc-REFRAG
- Gotit.pub
- Hugging Face
- retrieval-augmented generation
- RL-based selector
- ScienceCast
- BM25F
- ColQwen2.5
- ViDoRe V3
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →