研究人员推出了 Q2D-Web,这是一个新的大规模基准测试,旨在评估 Agentic 检索增强生成 (RAG) 管道中的检索系统。该基准测试通过将包含 1.9 亿个文档的大型网络语料库与源自真实用户对话的 7 万个 Agent 重新制定的搜索查询配对,解决了现有数据集的局限性。Q2D-Web 提供了多个相关性判断集,并探索了子语料库采样技术,以在保持模型排名准确性的同时,加快评估速度。 AI
影响 为评估复杂 RAG 系统中的检索组件提供了新的标准,有望提高 Agentic AI 的性能。
排序理由 该集群描述了一个用于评估 AI 检索系统的新学术基准测试。
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →