text-to-SQL 基准测试领域,主要由 BIRD 和 Spider 主导,通常使用不能反映真实用户应用的模式。作者介绍了 'persona-bench',这是一个新基准,其模式和查询代表了用户与 nlqdb 等产品典型交互的场景。这个新基准使用与 BIRD 和 Spider 相同的评分机制,显示了其系统显著更高的准确率,强调了在评估实际场景中的 text-to-SQL 性能时使用相关基准的重要性。 AI
影响 强调了在 text-to-SQL 中需要更现实的基准测试,以更好地反映实际应用性能。
排序理由 为评估 text-to-SQL 模型引入了新基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →