PulseAugur
实时 02:53:40
English(EN) Your text-to-SQL model isn't as wrong as your benchmark says. The gold SQL is.

文本到 SQL 基准测试错误突显了有缺陷的黄金标准

对 BIRD-dev 文本到 SQL 基准测试的新分析揭示了其黄金标准 SQL 注释存在重大问题,近 20% 的模型错误源于基准测试错误地将正确的模型输出标记为错误。研究人员发现,基准测试的评分机制经常因为模型添加了 `DISTINCT` 子句而惩罚模型,而这些子句实际上比提供的黄金 SQL 更准确。这表明,由于过度拟合有缺陷的注释,直接针对基准测试分数进行优化可能会导致模型在实际应用中表现更差。 AI

影响 强调了在 LLM 开发中高质量评估数据集的关键需求,以确保模型能够很好地泛化到实际任务。

排序理由 该项目讨论了关于基准数据集质量及其对模型评估影响的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

文本到 SQL 基准测试错误突显了有缺陷的黄金标准

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Omer Hochman ·

    您的文本到 SQL 模型并不像您的基准测试所说的那样错误。黄金 SQL 才是。

    <p><em>Originally published at <a href="https://nlqdb.com/blog/bird-gold-noise-distinct/?utm_source=devto" rel="noopener noreferrer">nlqdb.com/blog</a></em></p> <p>You run BIRD-dev, read an execution accuracy of 0.512, and the instinct is immediate: start writing planner directiv…