BIRD-Critic
PulseAugur coverage of BIRD-Critic — every cluster mentioning BIRD-Critic across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
神经符号层提升 LLM 数据工程的准确性和效率
研究人员开发了一种新颖的神经符号层,可以集成到现有的 LLM 中,以在无需微调的情况下提高其在数据工程任务上的性能。该层增强了逻辑推理能力,在 BIRD-CRITIC 和 LiveSQLBench 等基准测试中的准确率平均提高了 85%。此外,该方法通过压缩相关上下文信息来解决 Transformer 架构的计算瓶颈,将有效令牌使用量减少了 50% 以上,并将长上下文任务的时间复杂度接近 O(n)。
-
新的ACTS-SQL框架通过代理式调试提升Text-to-SQL准确性
研究人员开发了ACTS-SQL,一个用于提高Text-to-SQL系统准确性的新颖框架,将SQL纠错视为一个树状结构的调试过程。这种无需训练的方法结合了多种纠错策略,允许回溯以减轻错误传播,并整合了基于执行的验证以实现精确的错误定位。当部署在火山引擎的Torch Log Service中时,ACTS-SQL使用GPT-5作为骨干,在真实用户查询上的执行准确率从36.77%提升到53.61%。
-
DivSkill-SQL通过互补代理训练提升文本到SQL集成能力
研究人员开发了DivSkill-SQL,一个用于增强文本到SQL集成的创新框架。该方法通过在现有集成失败的示例上训练新代理来优化互补技能,从而提高生成至少一个正确SQL候选的概率。在Spider2-Lite数据集上使用Opus-4.6和GPT-5.4基础模型进行测试时,该框架在Snowflake上将准确率提高了11.1个百分点,在BigQuery上提高了8.3个百分点。值得注意的是,这些优化后的技能在不同SQL方言和任务表述之间表现出…