Spider 2.0
PulseAugur coverage of Spider 2.0 — every cluster mentioning Spider 2.0 across labs, papers, and developer communities, ranked by signal.
-
新的DBCC方法压缩数据库上下文以改进文本到SQL
研究人员开发了一种称为数据库上下文压缩(DBCC)的新方法,以提高在大型真实世界数据库上进行文本到SQL的性能。该方法通过将模式、描述和文档压缩成更紧凑的格式来解决数据库表示的瓶颈。DBCC利用SGCF原理进行离线结构和语义压缩,显著减小了输入上下文的大小,并提高了文本到SQL系统的模式链接召回率和端到端执行准确性。
-
LLM 在处理复杂 SQL 时遇到困难,带来生产风险
最近的基准测试显示,在生成复杂、真实的企业场景 SQL 查询时,大型语言模型 (LLM) 的准确性显著下降。虽然 GPT-4o 等模型在 Spider 1.0 等较旧、较简单的基准测试中表现良好,但在 Spider 2.0 和 BIRD-Interact 等更现实的数据集上的准确率却骤降至 10% 左右。这种性能下降恰逢用于编写生产数据库迁移的 AI 编码代理使用量增加,引发了对实时系统中潜在的静默故障的担忧。为减轻这些风险,文章建议…
-
Postgres 采用率激增,但 AI 代理集成带来安全风险
根据 Stack Overflow 2025 年度开发者调查,PostgreSQL 已成为采用最广泛的数据库,超过 55% 的开发者使用它。这种受欢迎程度的激增使其成为通过模型上下文协议 (MCP) 服务器与 AI 代理集成的首选目标。虽然将数据库连接到 AI 助手以执行模式探索和查询草稿等任务具有优势,但必须管理重大的安全风险。过去 MCP 服务器实现中的漏洞曾暴露敏感数据并允许未经授权的命令执行,这凸显了仔细配置和使用生产就绪服务…
-
文本到SQL在真实数据上的准确性骤降
尽管文本到SQL的演示似乎已解决,但当应用于真实的数据库时,其准确性会急剧下降。这种显著的下降并非由于语言模型的智能,而是由于结构、安全性和正确性方面的挑战。本系列将探讨当前系统面临的七个具体障碍,并认为成功的方法需要为模型提供一个模式图,清晰地区分确定性输出和生成性输出,并保持数据局部性。
-
新的EntSQL基准测试企业知识中的文本到SQL
研究人员推出了EntSQL,一个旨在评估企业环境中文本到SQL能力的新基准测试。与之前的基准测试不同,EntSQL专注于在长上下文、专有业务文档中进行SQL生成。该基准测试包含跨越五个业务领域的1,066个对齐的中英文示例,其中许多示例需要超出即时问题和模式的知识。当前系统在此任务上面临挑战,表现最好的模型在提供长篇文档时,在英文输入上的准确率仅为15.9%。