研究人员推出了LakeQuest,这是一个旨在评估问答系统在真实数据湖上表现的新基准测试。该基准测试包含在三个领域(AI/ML元数据、零售银行和生物医学信息)中的9,846个人工验证的问答对。使用检索增强生成(RAG)和代理工具使用方法进行的初步评估显示,当前系统在关系链、策略基础和联合表格问答等领域面临重大挑战,表明需要改进发现和组合机制。 AI
影响 突出了当前问答系统在真实数据湖场景中的局限性,推动了对改进检索和推理能力的研究。
排序理由 该集群描述了一篇新发布的关于arXiv的学术基准测试论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →