实体
LakeQA
LakeQA
PulseAugur coverage of LakeQA — every cluster mentioning LakeQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
时间线
- 2026-06-09 research_milestone Researchers introduced LakeQA, a new benchmark for evaluating LLMs on search-centric question answering over large data lakes. 来源
最近 · 第 1/1 页 · 共 2 条
-
新的SANA框架诊断数据湖问答中LLM代理的失败
研究人员推出SANA,一个旨在评估大型语言模型(LLM)代理在海量数据湖上的探索性问答(EQA)性能的诊断框架。SANA将端到端准确性分解为搜索、规划和数据分析等特定组件,识别代理行动策略中的瓶颈和失败。通过为每个组件创建理想化的工具并进行消融实验,SANA提供了诊断证据,以查明代理在何处遇到困难,从而能够更系统地比较代理设计进展。
-
新的LakeQA基准通过海量数据搜索和推理挑战LLM
研究人员推出了LakeQA,这是一个旨在测试大型语言模型在海量数据湖中搜索和推理能力的新基准。该基准使用了约9.5 TB的各种数据,包括维基百科和政府数据集,需要跨多个来源进行多跳推理和证据组合。初步实验表明,即使是GPT-5.2等先进模型也难以胜任这项任务,精确匹配得分仅为18.37%,凸显了LakeQA在开发有效的LLM代理方面所带来的挑战。