Lakehouse
PulseAugur coverage of Lakehouse — every cluster mentioning Lakehouse across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
Databricks 在 VLDB 2026 上展示人工智能时代创新
Databricks 将在 VLDB 2026 上展示与 Lakebase、流处理和 Lakehouse 技术相关的创新。这些进步旨在支持人工智能时代日益增长的需求。该公司将分享这些技术如何增强其平台。
-
Databricks 阐明数据网格与数据编织架构
Databricks 区分了数据网格(data mesh)和数据编织(data fabric)这两种数据管理架构方法。数据网格将数据所有权去中心化给领域团队,由他们将数据视为产品,从而解决组织瓶颈。相反,数据编织是一个技术驱动的自动化层,通过元数据和机器学习统一分布式数据,解决技术碎片化问题。Databricks 建议,采用 Lakehouse 架构的混合方法,可以通过集中治理实现领域自主性,从而结合两者的优点。
-
Databricks 在 Lakehouse 中直接为 SQL 实现声明式 ETL 模式
Databricks 正在增强其 Lakehouse 平台,使 SQL 从业者能够直接在 SQL 查询中使用声明式模式进行 ETL 处理。此举旨在简化复杂的数据转换逻辑,允许用户在无需大量自定义编码的情况下定义仅追加更新、变更数据捕获 (CDC) 和批量覆盖。通过扩展 Apache Spark Declarative Pipelines 的声明式执行模型,Databricks 允许用户描述所需的数据表或视图,平台将负责调度、刷新和增量处理。
-
Databricks通过新功能简化SQL到Lakehouse的迁移
Databricks推出了新的SQL功能,旨在简化遗留数据仓库存储过程到其Lakehouse平台的迁移。这些增强功能旨在减少在Python和Apache Spark等语言中进行昂贵重写的需求,使SQL开发人员能够以最小的改动维护其现有的业务逻辑。关键改进包括对临时表和游标的支持,直接解决了常见的迁移障碍,并实现了与Unity Catalog等工具的更好集成,以增强治理和可发现性。
-
Databricks Feature Store 为 ML 模型实现亚秒级新鲜度
Databricks 增强了其 Feature Store,为机器学习模型提供亚秒级新鲜度,满足了欺诈检测和个性化等应用对实时数据的需求。更新后的 Feature Store 允许数据科学家一次定义特征,并在批量和实时管道中进行部署。它利用 Apache Spark Real-Time Mode、Lakebase 和 Model Serving,实现了从通过 Apache Kafka 进行数据摄取到特征可用性的端到端 p99 延迟为 …
-
Databricks 在湖仓一体中推出用于多模态数据的原生 FILE 类型
Databricks 推出了一项名为 FILE 类型的新测试版功能,旨在将文档、图像和视频等非结构化数据作为原生列存储在表中。这项创新旨在将多模态数据直接集成到湖仓一体中,使其能够与结构化数据一起进行查询、保护和管理。该公司正与社区合作,将 FILE 类型对 Apache Parquet 和 Delta Lake 的支持嵌入其中,以确保广泛的生态系统兼容性和数据可移植性。
-
Microsoft Fabric 通过 OneLake 集成 Lakehouse 和 Warehouse 选项
Microsoft Fabric 在统一平台中同时提供 Lakehouse 和 Warehouse 选项,并利用 OneLake 进行数据存储。Lakehouse 架构以 Apache Spark 和开放的 Delta Parquet 表为中心,非常适合处理非结构化和半结构化数据,并具备将原始文件解析和转换为结构化表的能力。这种方法允许通过 SQL 分析终结点直接查询,从而连接数据工程和 BI 报告。
-
Databricks 推出用于 SQL 代码迁移的 AI 代理
Databricks 推出了由 Genie Code 提供支持的代理代码转换器,以简化专有 SQL 方言到开放 ANSI SQL 的迁移。此 Beta 功能支持从 T-SQL、Snowflake、Redshift、Oracle、BigQuery 和 Teradata 进行转换。该工具可自动执行迁移规划、使用并行代理进行代码转换,并在 Databricks 工作空间内提供 lineage 跟踪来管理该过程。
-
Databricks MCP 服务器授予 AI 代理直接访问 Lakehouse 的权限
Databricks 发布了一款新工具 Databricks MCP 服务器,它允许 Claude 等 AI 代理直接访问和交互用户的数据 Lakehouse。此次集成支持对话式执行 Notebook、针对 Delta Lake 的 SQL 查询、计算资源管理以及数据沿袭和 MLflow 工件的检查。该工具旨在通过允许代理查询数据、检查作业状态和提取见解,而无需手动干预,从而简化数据分析和工程的 AI 工作流。
-
基于 MLOps 原则构建的酒店业 Lakehouse 数据平台
本文详细介绍了利用 Lakehouse 架构构建的酒店业数据平台。该平台旨在管理各种数据流,包括预订、收入、入住率、支付对账和需求预测。重点在于 MLOps 原则,以确保酒店业高效的数据管理和分析。
-
Databricks提供通过SQL、SDP或PySpark进行ETL迁移的框架
Databricks推出了一项新框架,旨在帮助组织迁移现有的ETL(提取、转换、加载)管道。该框架概述了三种主要的迁移路径:利用Databricks SQL处理以SQL为主的工作负载,采用Spark声明式管道(SDP)进行自动化编排和数据质量管理,或使用PySpark和Spark SQL笔记本进行复杂逻辑和自定义集成。这种方法鼓励采用分阶段迁移策略,而非一次性大规模切换,同时利用Lakebridge和AI辅助代码转换等工具来协助这一过程。
-
Databricks 概述现代数据管道架构和部署的最佳实践
Databricks 发布了一份关于数据管道最佳实践的综合指南,涵盖了架构、现代管道设计和部署策略。该指南强调了深思熟虑的架构选择对于可靠性和成本效益的重要性,包括在批处理和流式处理模式之间进行选择以及优化存储。它还强调了版本控制、CI/CD 和全面的监控等强大的运营实践对于生产就绪的必要性。
-
Databricks Lakebase 增加变更数据源,实现直接操作数据访问
Databricks 为其 Lakebase 产品推出了新的变更数据源 (CDF) 功能,现已公开预览。此功能允许各种引擎、模型和代理直接访问操作数据,无需复杂的、手动的数据管道。通过将 CDF 存储在 Unity Catalog 管理的表中,Lakebase 旨在简化面向代理开发的数据集成,并为整个数据生命周期提供统一的治理和血缘关系。
-
提出AI增强型湖仓架构以改进数据治理
一篇新论文提出了一种基于湖仓架构的AI增强型中心辐射模型,以应对企业数据平台的挑战。该方法使用一个中心枢纽进行AI赋能的治理,自动化标准化数据产品和起草数据合同等任务。特定领域的辐射节点管理业务语义并迭代开发数据产品,大型语言模型促进跨职能专业知识,自然语言接口使业务用户能够更广泛地访问数据。
-
Databricks 指导分析团队选择适合现代数据需求的数据仓库工具
Databricks 发布了一份选择数据仓库工具的指南,强调了在性能、可扩展性、集成、成本和治理方面进行评估的重要性。该公司提倡将湖仓一体架构作为现代标准,能够在统一平台上支持 SQL 分析、机器学习和 AI。这种方法旨在降低与碎片化数据系统相关的成本和复杂性,符合数据仓库市场的预期增长以及组织向现代数据架构日益增长的转变。
-
Databricks 与 Snapchat 合作,直接向广告商发送转化数据
Databricks 已将 Snapchat 的 Conversions API 集成到其 Marketplace 中,允许企业直接从其 Lakehouse 将第一方转化数据发送到 Snapchat。此集成旨在通过安全、服务器端的数据传输提高事件匹配质量,从而改善广告活动效果。该解决方案在 Databricks 工作空间内使用预构建的笔记本,无需自定义连接器或中间件,并确保数据治理和安全。
-
Databricks 使用 Hydra 扩展监控;nOps 在 Lakebase 上重建
Databricks 开发了一个名为 Hydra 的新监控平台,构建在其 Lakehouse 架构之上,以处理其海量运营规模,每日摄取超过 10 万亿个样本并管理 50 亿个活跃时间序列。该平台解决了高基数指标的挑战,并旨在实现更少干预、自我修复的基础设施。同时,nOps 使用 Databricks Lakebase 重建了其云优化平台,整合了其应用程序和分析,以实现更简单、更快的架构。此外,多家公司正在推出旨在简化跨 AWS、GCP…