DuckDB
PulseAugur coverage of DuckDB — every cluster mentioning DuckDB across labs, papers, and developer communities, ranked by signal.
- 2026-06-01 product_launch DuckDB announced Quack, a new remote protocol over HTTP. 来源
4 天有情绪数据
-
使用 DuckDB、S3 和 SQL 实现 LLM 可观测性
本文提出了一种使用 DuckDB 和 Amazon S3 等现有工具实现 LLM 可观测性的经济高效的方法。文章概述了如何利用现有日志和 SQL 查询来实现分析、护栏和跟踪数据,而无需依赖昂贵的第三方供应商。该方法侧重于通过利用已有的基础设施来最大化节省。
-
Databricks 为 Apache Iceberg 治理引入读取限制
Databricks 为 Apache Iceberg 引入了新功能,专注于加强跨各种引擎的数据治理。更新包括读取限制和目录标签,旨在使治理策略更具可移植性和可执行性。读取限制标准化了目录如何将数据访问策略的执行委托给受信任的引擎,确保在读取数据时应用行和列限制。
-
新框架统一太阳能分析、问答和预测
一篇新研究论文介绍了一种名为“太阳能智能”(Solar Intelligence)的混合框架,旨在统一太阳能分析、科学问答和机器学习预测。该系统整合了来自 NASA POWER、Biosphere 2 和研究论文语料库的数据。它使用 DuckDB 进行结构化查询,融合 BM25 和 ChromaDB 以从语言模型中获取基于证据的答案,并使用 XGBoost 模型进行每日预测。该框架可通过多个接口访问,服务于学生、研究人员和能源分析师。
-
Databricks 通过 Apache Iceberg 规范增强 Open Lakehouse 治理
Databricks 推出了 Apache Iceberg 的新规范,重点关注读取限制和目录标签,以增强 Open Lakehouse 架构内的治理。这些进步旨在使数据治理像数据本身一样具有可移植性,允许在 Unity Catalog 中定义的策略跨 Apache Spark、DuckDB 和 Trino 等各种引擎得到一致执行。读取限制功能标准化了委托执行,使目录能够将行和列限制传递给受信任的引擎进行应用,从而简化了跨引擎数据访问和策略管理。
-
AWS 收购 DuckDB 创建者,将其定位为数据的“连接组织”
Amazon Web Services (AWS) 已收购 DuckDB 的幕后公司 DuckLabs。AWS 副总裁 Andy Warfield 表示,DuckDB 将作为整个数据领域的“连接组织”,使开发人员能够在应用程序内构建分析功能,并无缝连接到各种数据源,包括 AWS 的 Redshift 和 RDS,以及 Google 的 BigQuery 和 Microsoft Fabric 等竞争对手。DuckDB 数据库将继续在 M…
-
新的分析系统采用“先问分析师”的主动方法
一篇新的研究论文介绍了一种用于对话式分析系统的新方法——“先问分析师”方法,将范式从用户提出问题转变为系统主动协助分析师。这是通过一种充当自包含主题包的“技能”抽象来实现的,该抽象根据数据集和客户自动选择。此外,一个离线知识编译循环使用一个代理通过DuckDB探测数据集、验证数据连接,并在用户与查询框交互之前生成已验证的报告以及建议的后续问题。
-
Simon Willison 发布 alchemy-utils alpha 版,AI 辅助开发
Simon Willison 发布了 alchemy-utils 的两个 alpha 版本,这是一个 Python 库,旨在提供一个类似于他现有 sqlite-utils 库的数据库无关接口。该项目借助 Codex 和 GPT-5.6 Sol Ultra 开发,目标是通过 SQLAlchemy 支持多种数据库引擎。初步的测试和发布集中在 PostgreSQL 和 DuckDB,最近的更新 (0.1a1) 特别改进了 DuckDB 导出…
-
AI原生第二大脑使用多重RAG以获得更深层上下文
文章提出了一种AI原生“第二大脑”架构,该架构通过整合多种检索策略,超越了传统的检索增强生成(RAG)。这种多重RAG方法旨在为Claude等AI模型提供对代码库、个人笔记和通信平台等多样化数据源的更全面理解。通过结合语义搜索、关键词搜索、知识图谱和记忆检索,该系统能够回答更广泛的问题,从概念理解到特定的标识符查找和关系映射。
-
DuckDB 集成 Clojure;马斯克抢了 SpaceX 高管的风头
此集群包含两条不相关的突发新闻。第一条讨论了数据处理工具 DuckDB 及其与 Clojure 的集成。第二条报道了埃隆·马斯克在 SpaceX 首次财报电话会议上的行为,据报道他抢了高管的风头。
-
新基准 InferQ 评估基于 SQL 的量子电路模拟
研究人员开发了 InferQ,这是一个旨在评估关系数据库管理系统 (RDBMS) 在模拟量子电路方面性能的新基准测试。该基准测试生成了大量多样化的电路数据集,并将它们的模拟编译成 SQL 查询,从而能够对查询优化和引擎级评估进行系统性研究。实验表明,在内存使用方面,RDBMS 在超过一半的测试电路中可以优于 Qiskit Aer 等传统模拟器。此外,在 InferQ 提取的特征上训练的机器学习模型可以准确预测何时基于 SQL 的模拟更…
-
AI 团队使用 DuckDB、Polars 和 Parquet 简化数据管道
本文详细介绍了 AI 团队如何采用更高效的数据管道架构。它强调了使用 DuckDB、Polars 和 Apache Parquet 作为构建更快、更简单的数据处理系统的关键组件。该方法旨在取代传统的、更复杂的 ETL(提取、转换、加载)堆栈。
-
开发者为 3100 万条股票数据记录构建了 AI 可访问的 SQL 服务器
一位开发者创建了 Shibui Finance,一个 MCP 服务器,为 Claude 等 AI 模型提供对海量美国股市信息数据集的直接 SQL 访问。该系统从商业 API、SEC EDGAR 文件和 FRED 等各种来源摄取数据,通过 PostgreSQL 和 dbt 进行处理,然后导出到 DuckDB。这种架构允许高效查询 3100 万条价格记录、季度财务数据、技术指标和 SEC 文件数据,通过预先计算指标将查询时间从几分钟缩短到几毫秒。
-
LLM网关路由切换器捕获数据以优化提示
Skelf-Research开发的路由切换器LLM网关,通过捕获和利用调用数据,为改进提示提供了一种新颖的方法。与仅仅路由请求并丢弃提示数据的传统网关不同,路由切换器将每次交互都存储在SQLite数据库中。然后,通过包括生成、贝叶斯优化和评估在内的六个步骤,利用捕获的数据来迭代地优化提示。该系统支持OpenAI、Anthropic和Google等多个LLM提供商,并通过模仿OpenAI API来设计,易于集成。
-
Claude AI 与 dbt 项目集成,实现自然语言数据模型查询
一项新的集成允许用户将 Anthropic 的 Claude AI 模型连接到他们的 dbt 项目,从而能够就数据模型和 lineage 进行自然语言查询。这种连接由 dbt MCP 服务器促进,该服务器充当 Claude 和 dbt CLI 之间的桥梁。用户可以要求 Claude 直接在其 dbt 环境中执行诸如编译模型、运行测试和诊断错误等操作,并使用项目的 manifest.json 文件作为上下文。
-
AI 代理:语义层优于 Text-to-SQL,增强数据仓库的信任度
本文提出了一种更可靠的将 AI 代理连接到数据仓库的方法,超越了传统的 Text-to-SQL 方法。作者主张在语义层定义业务指标,并通过模型上下文协议 (MCP) 公开它们。这通过向代理提供受管的指标定义,而不是可能导致幻觉和不一致的原始表访问,来确保一致性和信任度。所提出的架构允许更轻松的基础设施更改,并提供访问控制和审计跟踪等基本功能。
-
新工具可在 AI 代理中实现交互式图表
MCP Charts 工具 (@bonnard/mcp-charts) 使 AI 代理可以直接在 Claude 和 ChatGPT 等平台中生成交互式图表,无需前端开发。该工具允许代理查询 PostgreSQL、BigQuery、Snowflake、Databricks 和 DuckDB 等数据源,返回确定性的可视化图表,而不是原始数据或即兴生成的 HTML。通过提供专用的图表工具,它确保了在对话式 AI 界面中进行数据探索时的一致渲…
-
Salesforce架构师利用AI为Rust ETL工具添加Salesforce集成
一位Salesforce架构师利用AI编码助手成功地将Salesforce连接器集成到开源ETL工具Duckle中。该架构师提供了领域专业知识和需求,而AI Claude Code则生成了必要的Rust和TypeScript代码。通过这种协作,在五天内完成了四个合并的拉取请求,包括一个新的Salesforce sink组件和加密凭证存储。
-
Databricks 实现外部引擎访问 Unity Catalog 管理表
Databricks 宣布,外部引擎现已可在公共预览版中创建、读取和写入 Unity Catalog 管理的 Delta 表。此功能基于开放的 UC Delta API 构建,允许 Apache Spark、Apache Flink 和 DuckDB 等引擎访问和修改数据,并由 Unity Catalog 强制执行集中式治理。管理表还利用 Predictive Optimization 提高查询性能并降低存储成本,无需手动调优。
-
开源A股量化工具将LLM用作助手而非预言家
一个名为tickflow-stock-panel的新开源项目为中国A股市场提供了一个自托管工作台,专注于筛选、监控和回测。该工具刻意避免AI驱动的选股,而是使用大型语言模型作为助手,用于生成筛选策略和市场回顾等任务。它强调在投资决策中保留人类的参与,并允许用户连接到任何兼容OpenAI的LLM端点,包括本地模型。
-
大型语言模型绕过数据库驱动程序直接读取存储文件
一种名为 Jailbreak 的新方法使用大型语言模型 (LLM) 来绕过传统的数据库驱动程序并直接读取存储文件。通过摄取数据库源代码和文档,LLM 可以再生专门的读取器,将数据物化到内存中的列式缓冲区。该方法已显示出显著的性能改进,在 PostgreSQL 和 MySQL 等系统的分析吞吐量方面实现了高达 27 倍的加速,并生成了与 DuckDB、Apache Spark 和 cuDF 等引擎兼容的 Apache Arrow 缓冲区。