web crawler
PulseAugur coverage of web crawler — every cluster mentioning web crawler across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
LLM文本到SQL基准按自主性轴分析 · 跟踪到1个来源
一篇新论文重新审视了LLM文本到SQL领域,提出了一种基于自主性的分类法和经验基准分析。作者收集了报告的指标,并沿着推理自主性轴进行组织,涵盖了受限、上下文内、迭代、Agentic和推理内化生成。他们对Spider基准进行的案例研究比较了各种开源模型(有无思维链监督)与既有基线,结果表明自主性增加是有代价的,并且思维链监督主要使更复杂的查询受益。
-
新研究通过模式探索和DBMS反馈解决LLM文本到SQL生成问题
两篇新研究论文提出了改进大型语言模型(LLM)从自然语言生成SQL查询的准确性和效率的新方法。DexterSQL专注于深度模式探索和基于规则的纠错,以解决列名歧义和SQL生成失败等问题,在GPT-4o和GPT-5.2等模型上显示出显著的准确性提升。另一方面,SafeQL重新定义了数据库管理系统(DBMS)作为主动指导者的角色,利用基于搜索的优化,根据DBMS的反馈逐步修复错误的SQL组件,从而在Bird和Spider等基准测试中提高了…
-
RingSQL框架生成合成数据以增强文本到SQL模型
研究人员开发了RingSQL,一个用于生成合成问题-SQL对以改进文本到SQL模型的新型混合框架。该方法结合了模式无关的查询模板和基于LLM的问题释义,确保正确性的同时扩展数据生成。RingSQL的合成数据集在RLVR训练中表现出改进的性能,在Spider和BIRD等基准测试中达到了69.8%的平均准确率,并优于现有的合成数据集和人工标注数据。
-
新基准 'persona-bench' 凸显 text-to-SQL 准确率差距
text-to-SQL 基准测试领域,主要由 BIRD 和 Spider 主导,通常使用不能反映真实用户应用的模式。作者介绍了 'persona-bench',这是一个新基准,其模式和查询代表了用户与 nlqdb 等产品典型交互的场景。这个新基准使用与 BIRD 和 Spider 相同的评分机制,显示了其系统显著更高的准确率,强调了在评估实际场景中的 text-to-SQL 性能时使用相关基准的重要性。
-
AttnLink框架将LLM注意力转化为文本到SQL的模式链接
研究人员推出了一种名为AttnLink的新型框架,旨在通过将语言模型的内部注意力机制转化为模式项的相关性分数来增强文本到SQL系统。这种方法允许在单次传递中高效地对模式候选进行排名,从而减少推理延迟。开发了两种变体:AttnLink-U和AttnLink-S,其中AttnLink-S结合了直接监督,以使注意力分布与黄金模式项对齐。在Spider、BIRD和Spider2-SQLite等基准数据集上的实验表明,AttnLink-S在模式…
-
新的 Text-to-SQL 框架学习何时进行推理,提高效率
研究人员开发了 AutoThinkSQL,一个旨在优化 Text-to-SQL 模型的新框架,使其能够动态决定何时使用复杂推理(Chain-of-Thought)以及何时绕过它来处理简单查询。该方法将自动思考整合到监督微调(SFT)和直接偏好优化(DPO)过程中。当应用于 Qwen3-Coder-30B-A3B 模型时,AutoThinkSQL 在 Spider 和 BIRD 基准测试中表现出持续的改进,同时与始终采用 Chain-o…
-
Desbordante 数据分析器增强了复杂依赖关系的发现 · 跟踪 3 个来源
研究人员开发了 Desbordante,一个用 C++ 实现的开源数据分析器,用于高效地发现包含依赖关系和图函数依赖关系 (GFDs)。该工具采用了并行化、数据缓冲和专门的哈希表选择等优化措施,以显著提高性能。与现有方法相比,Desbordante 在包含依赖关系发现方面速度提高了 8 倍,在 GFD 验证方面提高了 3 倍,使得在消费级硬件上进行这些复杂的数据分析任务更加容易。
-
EvoSQL框架通过批评-生成器协同进化增强文本到SQL
研究人员开发了EvoSQL,一个新颖的框架,旨在通过将SQL合成视为生成器和批评者之间的迭代过程来增强文本到SQL的能力。该系统包含一个内存组件来存储和验证SQL候选,利用执行信号和基于LLM的批评进行优化。EvoSQL还包括一个自蒸馏策略优化(SDPO)阶段,以执行感知的监督来微调编码LLM,在Spider和BIRD等基准数据集上取得了显著改进,特别是对于Qwen3-4B和Qwen2.5-Coder-3B等开源模型。
-
新方法提高了SQL模式检索的准确性
研究人员开发了一种新的SQL模式检索方法,专注于为自然语言查询识别相关的表和列。他们将现有的text-to-SQL数据集改编为检索任务,并发现标准的嵌入器表现不佳。为解决这个问题,他们提出了一种语料库自适应微调技术,该技术可以从目标模式合成查询并挖掘困难的负例。这种方法显著提高了召回率和nDCG分数,将模式链接确立为一个独立的检索任务,并为企业规模的部署提供了实用的解决方案。
-
新的基准和自适应嵌入提高了 SQL 模式检索性能
研究人员推出了一种新的 SQL 模式检索基准和语料库自适应嵌入方法。这是文本到 SQL 任务中的关键一步,涉及在大型数据库中识别相关的表和列。他们调整了五个现有的文本到 SQL 数据集以用作检索任务,并发现标准的文本和代码嵌入器表现不佳。通过使用合成查询和难负例微调一个 305M 参数的嵌入器,他们将 recall@10 从 60.4% 显著提高到 75.6%,将模式链接确立为一个独立的检索问题,并展示了一种在企业规模部署的实用方法。
-
新框架GradeSQL提升LLM在文本到SQL任务中的可靠性
研究人员开发了GradeSQL,一个用于提高大型语言模型(LLM)在文本到SQL任务中可靠性的新框架。该框架利用结果奖励模型(ORMs)作为测试时验证的学习语义评分函数。GradeSQL使用自动候选生成和基于执行的标注来训练这些ORMs,无需人工标注。当集成到Best-of-N管道中时,基于ORM的选择在BIRD和Spider基准测试上的性能显著优于传统方法。
-
新研究通过增强的 LLM 推理能力提升 Text-to-SQL 的准确性
arXiv 上发布的三篇新研究论文探讨了 Text-to-SQL 技术的进展,重点在于提高大型语言模型(LLM)将自然语言问题转换为 SQL 查询的准确性和泛化能力。这些论文介绍了 CoTE-SQL、MapleDoctor 和 Reward-SQL 等新框架,它们采用了自我增强推理、错误检测与修复以及执行感知奖励等技术,以处理复杂查询并在 Spider 和 Bird 等基准测试中提升性能。这些方法旨在通过提高 LLM 驱动的 SQL …
-
Google 的 Gemini-SQL2 以 80.04% 的准确率在文本到 SQL 基准测试中名列前茅
Google Research 发布了 Gemini-SQL2,这是一种基于 Gemini 3.1 Pro 构建的新的文本到 SQL 功能。该系统在 BIRD 基准测试中达到了 80.04% 的执行准确率,超越了之前的记录,并缩小了与人类表现的差距。该技术旨在将自然语言转换为可执行的 SQL 查询,并可能应用于 Google 的各项数据服务。
-
生成式AI从网络污染到法西斯主义,造成广泛危害
生成式AI正在各个领域造成严重损害,包括用无视既定惯例的爬虫生成内容压垮网络流量。涌入的AI生成的“垃圾”页面使得查找真实信息变得困难,而AI摘要则使用户远离原始来源,并无视版权和创作者权利。此外,该技术还导致巨大的能源消耗、资源稀缺、资本主义权力转移以及可能助长法西斯主义的后真相环境的传播。
-
新系统通过自动化规则学习提高文本到SQL的准确性
研究人员开发了新的方法来提高文本到SQL系统的准确性,该系统将自然语言问题转换为数据库查询。TAHOE使用自动提示优化系统从错误中学习并指导大型语言模型,显著提高了在Spider 2.0-Snow等基准测试上的性能。SOMA-SQL通过生成合成查询日志并使用执行探测来解决含糊不清或不明确的问题,其表现优于最先进的基线。ZAS-SQL从失败案例中提炼规则以提高零样本文本到SQL的性能,确立了新的最先进水平,超越了一些少样本和微调方法。
-
新的EntSQL基准测试企业知识中的文本到SQL
研究人员推出了EntSQL,一个旨在评估企业环境中文本到SQL能力的新基准测试。与之前的基准测试不同,EntSQL专注于在长上下文、专有业务文档中进行SQL生成。该基准测试包含跨越五个业务领域的1,066个对齐的中英文示例,其中许多示例需要超出即时问题和模式的知识。当前系统在此任务上面临挑战,表现最好的模型在提供长篇文档时,在英文输入上的准确率仅为15.9%。
-
新方法通过执行反馈提高 Text-to-SQL 的准确性
研究人员开发了多种新方法来改进 Text-to-SQL 系统,该系统将自然语言问题转换为 SQL 查询。这些方法侧重于增强模式链接和利用执行反馈来优化 SQL 生成。GATE、ACE-SQL、CAPER 和 SIRIUS-SQL 等技术旨在应对复杂数据库模式和不明确查询带来的挑战,从而生成更准确、更鲁棒的 SQL 输出。
-
新框架通过灵活交互和细粒度反馈增强文本到SQL模型
研究人员开发了几个新框架来改进文本到SQL生成,特别是针对小型语言模型和复杂的数据库交互。FineStep和FINER-SQL引入了新颖的强化学习方法,具有步级信用分配和细粒度执行反馈,以提高准确性和效率。Rose-SQL利用小推理模型的上下文学习进行多轮查询,而FlexSQL专注于灵活的数据库交互和探索以更好地解释查询。此外,EGRefine通过优化命名约定来解决模式歧义,以提高各种模型在下游文本到SQL方面的性能。
-
RedParrot 通过语义缓存加速商业分析中的 NL-to-DSL
研究人员开发了 RedParrot,一个旨在加速将自然语言查询转换为领域特定语言以进行商业分析的新框架。该系统利用语义缓存将传入的查询与预先存在的模式进行匹配,显著降低了传统多阶段 LLM 管道的延迟和成本。在企业数据集上的实验表明,速度提高了 3.6 倍,准确率提高了 8.26%,在公共基准测试上也取得了显著的提升。
-
CLARITY框架解决对话式NL2SQL系统中的歧义问题
研究人员开发了CLARITY,一个旨在评估自然语言到SQL(NL2SQL)系统在交互式环境中处理歧义和不可回答查询能力的新框架和基准测试。与之前的基准测试不同,CLARITY生成复杂的歧义,并模拟了多轮对话中的多样化用户交互。对Spider和BIRD等现有数据集的评估显示,即使是那些由大型语言模型驱动的当前领先的NL2SQL系统,在面对这些多方面歧义时,性能也会显著下降,并且常常无法 pinpoint 问题的确切来源。