BigQuery
PulseAugur coverage of BigQuery — every cluster mentioning BigQuery across labs, papers, and developer communities, ranked by signal.
- developed by Google 100%
- subsidiary of .google 100%
- developed by .google 100%
- subsidiary of Google 100%
- competes with Snowflake 70%
- competes with Redshift 70%
- used by PostgreSQL 70%
- used by Looker 70%
- competes with Google Cloud Storage 70%
- uses Data Agent Kit 70%
- competes with PostgreSQL 60%
- competes with Delta Lake 60%
8 天有情绪数据
-
LLM在数据准确性方面遇到困难,在企业工作负载上准确率低于21%
将Claude和GPT-4等大型语言模型连接到数据源会产生出人意料的低准确率,在复杂企业工作负载上的准确率通常低于21%。这是因为模型难以理解模糊的字段定义,并且缺乏人类分析师的上下文理解能力。虽然连接器可以提供令人印象深刻的初步演示,但要获得可靠的结果,还需要强大的语义层、受治理的数据集和严格的评估工具,这些对于弥合原始数据访问与准确见解之间的差距至关重要。
-
如何使用GCP账单导出准确跟踪Vertex AI支出
本文详细介绍了如何通过分析账单导出数据来准确跟踪Google Cloud的Vertex AI支出。文章强调了使用详细的使用成本导出`gcp_billing_export_resource_v1`的重要性,该导出包含关键的资源级信息。指南解释了常见的陷阱,例如仅按SKU描述进行过滤而低估支出,以及在未考虑信用额度、承诺使用折扣或促销赠金的情况下误解“成本”列。文章提供了具体的BigQuery SQL查询,以正确计算净成本并将支出归因于各…
-
BigQuery ML 集成 Vertex AI 进行文本生成,并详细说明成本
BigQuery ML 用户现在可以创建引用 Vertex AI 端点的远程模型,从而直接在 BigQuery 中实现文本生成功能。此设置涉及创建一个充当中介进行授权的连接对象,从而防止分析师拥有直接的 IAM 角色。这些远程模型调用的定价在 BigQuery 的数据扫描成本和 Vertex AI 的令牌处理费用之间分配,其中 Vertex AI 成本通常在文本生成任务中占主导地位。
-
Google BigQuery 将生成式 AI 函数名称更新为 AI. 前缀
Google 已更新其在 BigQuery 中生成式 AI 函数的命名约定,将 'ML.' 前缀改为 'AI.'。具体来说,文本生成函数现在称为 AI.GENERATE_TEXT,取代了旧的 ML.GENERATE_TEXT。此更改会影响用户应如何编写新查询,尽管使用旧名称的现有查询将继续正常运行。本文档提供了有关使用新函数的使用指南,包括子查询中 'prompt' 列的要求以及用于控制成本和输出的推荐 STRUCT 参数,例如 te…
-
Looker 通过模型上下文协议 (MCP) 与 OpenAI 的 Codex 集成
本文详细介绍了如何配置模型上下文协议 (MCP) 以便与 Looker 和 OpenAI 的 Codex 一起使用。MCP 充当通用连接器,允许不同的 AI 代理与 Looker 等数据平台进行交互。此设置的先前版本使用了 Gemini CLI、Antigravity CLI 和 Claude Code 等其他代理,但此版本侧重于集成 Codex。Looker 是一个基于 Google Cloud 的商业智能平台,它使用 LookML…
-
Google Analytics 4 时区错误导致广泛的数据归因问题
Google Analytics 4 (GA4) 中一个严重的时区错误导致了广泛的数据归因问题,影响了依赖该平台获取营销洞察的企业。据报道,该错误影响了超过一百万用户,导致数据收集和分析不正确,可能歪曲营销活动绩效指标。Meta 等公司受到了影响,凸显了在数字广告和分析中准确处理数据的重要性。
-
Amazon、Google、Microsoft、OpenAI、Vercel推出AI代理插件标准 · 跟踪5个来源
Amazon、Cursor、Microsoft、OpenAI和Vercel合作制定了Agent Plugins,这是一个用于打包AI代理扩展的开放标准。这个新标准1.0.0版本旨在通过提供统一的代理技能和MCP服务器格式来简化开发流程,减少开发人员为不同AI客户端创建单独包的需求。Google已加入成为核心维护者,并计划将其Agent Plugins集成到自己的产品和工具中。
-
SAP云迁移因数据提取复杂性和政治因素而失败
大型企业的云迁移项目,特别是那些严重依赖SAP系统的项目,常常因低估数据提取的复杂性和政治挑战而失败。Lovelytics公司数据架构总监Naresh Sigamani指出,虽然Databricks和Snowflake等云平台功能强大,但其有效性取决于从SAP提取数据的质量和合规性。他强调,翻译专有的SAP业务规则需要专门的双语工程人才,以避免以更高的成本简单地复制遗留问题。
-
Databricks 提供 BigQuery 到 Lakehouse 迁移框架
Databricks 发布了一项战略框架,指导组织将其数据工作负载从 Google BigQuery 迁移到 Databricks Lakehouse 平台。该框架强调分阶段进行,重点关注评估当前的 BigQuery 使用情况,根据价值和复杂性确定迁移批次的优先级,并利用 Lakebridge 等工具进行自动化发现和迁移。目标是将数据存储、ETL、BI 和 AI 功能整合到一个统一的开放架构中,从而降低成本、改善治理并实现新的 AI 驱动用例。
-
Google Voice 付费套餐增加 AI 功能,用于垃圾邮件拦截和转录
Google Voice 正在通过 Google AI 驱动的高级功能来增强其付费订阅套餐。该服务提供虚拟电话号码以隐藏个人号码,现在所有套餐都包含由 AI 驱动的垃圾邮件拦截、语音邮件转录以及与 Google Meet 和 Calendar 的集成。付费套餐引入了通话录音、自动总机和笔记记录等功能,更高级别的套餐提供扩展的用户支持和国际通话选项。
-
Google Cloud 的无边界湖仓一体整合 AWS、Databricks、Snowflake 的数据
Google Cloud 推出了新的“无边界湖仓一体”计划,旨在消除跨不同云平台复制数据的需求。该服务目前处于预览阶段,允许数据管道和代理通过 Iceberg REST 目录直接访问位于 AWS Glue、Databricks Unity Catalog 和 Snowflake Horizon 中的数据。此外,Google 还为跨云数据传输提供统一费率定价层,并发布了一个开源 Data Agent Kit,该套件与 Model Con…
-
Databricks 推出用于 SQL 代码迁移的 AI 代理
Databricks 推出了由 Genie Code 提供支持的代理代码转换器,以简化专有 SQL 方言到开放 ANSI SQL 的迁移。此 Beta 功能支持从 T-SQL、Snowflake、Redshift、Oracle、BigQuery 和 Teradata 进行转换。该工具可自动执行迁移规划、使用并行代理进行代码转换,并在 Databricks 工作空间内提供 lineage 跟踪来管理该过程。
-
HyperNexus集中管理MCP服务器RBAC,简化AI治理
HyperNexus推出了一款企业级解决方案,用于管理模型上下文协议(MCP)服务器的角色基础访问控制(RBAC)。该平台解决了在多团队AI环境中重复配置或授予过于广泛权限的挑战。通过在编排层集中管理RBAC策略,HyperNexus可以在无需复制服务器实例的情况下,对Snowflake、BigQuery、PostgreSQL、GitHub和Jira等各种工具和数据源进行细粒度访问控制。这种方法旨在简化AI治理、防止配置漂移,并支持S…
-
开发者在 Google Cloud 上构建 AI 数据分析师,实现对话式商业智能
一位开发者在 Google Cloud 上创建了一个多智能体 AI 数据分析系统,旨在将自然语言的业务问题转化为可操作的见解和报告。该项目使用 Vertex AI 和 BigQuery 等 Google Cloud 服务构建,旨在通过允许业务用户以对话方式与数据交互来消除数据瓶颈。该系统超越了简单的数据检索,可以直接从数据库进行复杂推理和战略建议。
-
AI 代理:语义层优于 Text-to-SQL,增强数据仓库的信任度
本文提出了一种更可靠的将 AI 代理连接到数据仓库的方法,超越了传统的 Text-to-SQL 方法。作者主张在语义层定义业务指标,并通过模型上下文协议 (MCP) 公开它们。这通过向代理提供受管的指标定义,而不是可能导致幻觉和不一致的原始表访问,来确保一致性和信任度。所提出的架构允许更轻松的基础设施更改,并提供访问控制和审计跟踪等基本功能。
-
新工具可在 AI 代理中实现交互式图表
MCP Charts 工具 (@bonnard/mcp-charts) 使 AI 代理可以直接在 Claude 和 ChatGPT 等平台中生成交互式图表,无需前端开发。该工具允许代理查询 PostgreSQL、BigQuery、Snowflake、Databricks 和 DuckDB 等数据源,返回确定性的可视化图表,而不是原始数据或即兴生成的 HTML。通过提供专用的图表工具,它确保了在对话式 AI 界面中进行数据探索时的一致渲…
-
利用原生数据库元数据作为AI代理的轻量级语义层
一种新方法建议利用数据仓库的原生元数据和功能作为AI代理的轻量级语义层,而不是采用Cube.dev等专用工具或构建自定义框架。该方法包括创建具有清晰业务逻辑和定义的精选视图,并使用视图和列上的注释为代理提供上下文。通过利用主键和外键,并确保列名清晰易懂,这种策略可以显著提高代理发现和查询数据的准确性,有可能在极短的实现时间内实现近乎完美的表查找结果。
-
Google Research 发布 TimesFM 2.5,用于零样本时间序列预测
Google Research 发布了 TimesFM 2.5,这是一个开源的时间序列预测基础模型。该模型拥有 2 亿个参数和高达 16,384 个点的上下文窗口,无需特定任务的训练数据即可预测未来趋势,以零样本(zero-shot)方式运行。与 Auto ARIMA 等传统方法相比,它在基准测试中显示出更高的准确性,平均绝对误差(Mean Absolute Error)降低了 15-25%,尽管其在某些稳定时间序列上的表现可能与经典…
-
AI巨头在模型上下文协议实现上出现分歧
模型上下文协议(MCP)是人工智能模型与外部工具和数据交互的标准,已获得快速采用,拥有数百万SDK下载量和数千个公共服务器。虽然协议本身是标准化的,但Anthropic、OpenAI和Google等主要AI提供商对其实现方式各不相同,影响了开发者的选择。Anthropic的Claude倾向于本地优先的方法,允许直接访问本地资源;而OpenAI的ChatGPT则使用仅远程服务器,并将工具输出渲染为聊天界面内的交互式小部件。Google的…
-
GeoSQL 技能增强了 AI 模型进行地理空间数据分析的能力
GeoSQL 是一个新推出的开源技能,旨在增强 Claude、Codex 和 GitHub Copilot 等 AI 模型处理地理空间数据的能力。该工具集成了 PostGIS、BigQuery 和 Snowflake 等流行数据平台,在处理复杂的地理空间任务方面有了显著的改进。GeoSQL 通过采用包含地图可视化的代理循环来运行,这使其能够识别和纠正纯文本模型可能忽略的几何错误,从而实现了报告的 4 倍性能提升。