研究人员推出了TIDE-Bench,一个旨在评估大型语言模型(LLMs)在对话式文本到SQL任务上的新基准,特别关注链歧义和意图漂移。该基准建立在BIRD数据集的514个锚点SQL之上,包含1,542个样本,并引入了用于识别链歧义和解决意图漂移的指标,超越了简单的执行准确性。使用TIDE-Bench对12个LLMs的评估揭示了在链识别方面存在重大挑战,以及在识别和解决用户意图漂移方面存在显著差距。 AI
影响 该基准有望带来更强大的对话式AI系统,能够处理复杂的用户查询和修改。
排序理由 该集群包含一篇介绍用于评估LLMs的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →