研究人员开发了新的方法来改进视觉文档检索,特别是针对发票等大量相似文档的检索。一种名为 Invoice Haystack 的方法引入了一个基准,旨在测试检索系统在强视觉同质性条件下的性能,而现有方法在这种条件下由于嵌入塌陷而难以奏效。为了解决这个问题,提出了一种名为 VL-RAG 的新框架,该框架结合了文本和视觉嵌入以实现更精确的识别。另一种名为 LightSTAR 的方法侧重于效率,通过使用无 LLM 的选择过程来快速缩小相关页面的范围,然后再应用更精炼的语义匹配。这种方法在保持高精度的同时显著降低了延迟。 AI
影响 这些进展可以显著提高在拥有大量同质文档集合的企业环境中信息检索的效率和准确性。
排序理由 两篇介绍视觉文档检索新基准和新方法的论文。
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- LightSTAR
- Litmaps
- LLM-free visual embeddings
- LLM-free Visual Selection
- Multi-modal Large Language Models
- ScienceCast
- scite Smart Citations
- Vision-adaptive Semantic Refinement
- Invoice Haystack
- VL-RAG
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →