研究人员探索了如何利用视觉-语言模型(VLM)来改进视觉文档检索系统。研究发现,除了仅使用 VLM 来丰富正样本外,使用 VLM 来识别和判断困难的负样本可以显著提高检索性能。这种方法通过提炼 VLM 对不相关页面的判断,将 nDCG@5 分数从 55.2 提高到 62.6。研究结果表明,当 VLM 监督应用于负样本时,其效果更佳,而当前标记方法在很大程度上未能解决负样本问题。 AI
影响 通过利用 VLM 进行负样本识别,提高了视觉文档检索系统的有效性。
排序理由 该条目是一篇学术论文,详细介绍了一种改进视觉文档检索系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →