Delta Lake
PulseAugur coverage of Delta Lake — every cluster mentioning Delta Lake across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
数据聚类和 Z 排序通过实现数据跳过来优化表扫描
一篇技术文章解释了 Z 排序和数据聚类,这些技术用于优化大型表中的数据检索,特别是在 Delta Lake 等系统中。文章强调了传统分区可能不足以应对,导致查询效率低下,扫描大量无关数据。文章详细介绍了文件级最小/最大统计数据如何实现数据跳过,这是通过避免不必要的文件读取来提高查询性能的关键机制。
-
Amtrak 构建由 AI 驱动的数据主干以实现重大铁路转型
Amtrak 正在实施一个名为 Rail Intelligence 的综合性数字智能平台,该平台基于 Databricks 构建,以支持其 50 多年来最重大的运营转型。该平台旨在将来自新列车组、预订系统和基础设施项目等各种来源的数据统一到一个单一的治理层中。目标是通过利用实时数据和机器学习模型,实现预测性维护,提高运营准备能力,并改进资本决策。
-
Databricks 在湖仓一体中推出用于多模态数据的原生 FILE 类型
Databricks 推出了一项名为 FILE 类型的新测试版功能,旨在将文档、图像和视频等非结构化数据作为原生列存储在表中。这项创新旨在将多模态数据直接集成到湖仓一体中,使其能够与结构化数据一起进行查询、保护和管理。该公司正与社区合作,将 FILE 类型对 Apache Parquet 和 Delta Lake 的支持嵌入其中,以确保广泛的生态系统兼容性和数据可移植性。
-
分析建议停止将 Databricks 模式复制到 Microsoft Fabric
建议数据工程师避免在 Microsoft Fabric 中复制复杂的 Databricks 架构模式。文章认为,Fabric 的统一、无服务器和 SaaS 架构比 Azure Databricks 过去所需的复杂集群管理和优化技术更青睐简洁性。通过利用 OneLake 和其自动优化功能等 Fabric 的原生功能,团队可以减少技术债务,降低计算成本,并构建更强大的数据管道。
-
Databricks MCP 服务器授予 AI 代理直接访问 Lakehouse 的权限
Databricks 发布了一款新工具 Databricks MCP 服务器,它允许 Claude 等 AI 代理直接访问和交互用户的数据 Lakehouse。此次集成支持对话式执行 Notebook、针对 Delta Lake 的 SQL 查询、计算资源管理以及数据沿袭和 MLflow 工件的检查。该工具旨在通过允许代理查询数据、检查作业状态和提取见解,而无需手动干预,从而简化数据分析和工程的 AI 工作流。
-
陶氏公司利用 Databricks 构建碳账本以追踪产品排放
陶氏公司(Dow)已开发出碳足迹账本(Carbon Footprint Ledger, CFL),利用 Databricks 数据智能平台来简化其广泛产品组合的产品碳足迹(Product Carbon Footprints, PCFs)的计算。该系统构建在 Apache Spark 和 Delta Lake 等技术之上,将处理时间从数周大幅缩短至一小部分,同时确保数据沿袭和可审计性。CFL 的设计符合 ISO 14067 和 GHG …
-
机器学习和数据湖的数据版本控制工具评测
本文对机器学习和数据湖的数据版本控制工具进行了实用性概述。文章考察了 Dolt、DVC、Delta Lake、Iceberg、Hudi 和 lakeFS 等平台,深入探讨了它们有效管理和分析数据的能力。本次评测旨在帮助用户了解在 MLOps 工作流中进行可靠数据版本控制的可用选项。
-
Databricks 实现外部引擎访问 Unity Catalog 管理表
Databricks 宣布,外部引擎现已可在公共预览版中创建、读取和写入 Unity Catalog 管理的 Delta 表。此功能基于开放的 UC Delta API 构建,允许 Apache Spark、Apache Flink 和 DuckDB 等引擎访问和修改数据,并由 Unity Catalog 强制执行集中式治理。管理表还利用 Predictive Optimization 提高查询性能并降低存储成本,无需手动调优。
-
Azure、AWS、GCP 上的 MLOps CI/CD 和特征工程 · 跟踪 2 个来源
该集群探讨了在 Azure、AWS 和 GCP 等主要云平台上实现 MLOps 中的 CI/CD 管道。它强调了 MLOps 与传统 DevOps 的区别,强调了特征工程和可扩展数据处理的重要性。Azure Databricks 结合 Apache Spark 和 Delta Lake 等技术,被认为是管理大规模特征工程和 MLOps 工作流的关键工具。
-
数据湖与云数据仓库:选择正确的架构
本指南比较了数据湖和云数据仓库架构,重点介绍了它们在数据存储、查询性能、治理和成本方面的差异。数据湖因其读时模式(schema-on-read)方法和低成本对象存储,非常适合存储用于机器学习和高级分析的原始、多格式数据。相反,云数据仓库针对结构化数据和用于商业智能的高并发SQL查询进行了优化,采用写时模式(schema-on-write)方法。数据湖仓(Data lakehouses)被提出为一种解决方案,它结合了两者优点,在数据湖存…
-
Databricks 概述统一数据管道架构,推出 Lakeflow
Databricks 详细介绍了其数据管道架构方法,强调了一个整合批处理和流式数据处理的统一平台。该公司指出,有效架构将数据摄取、处理、存储和提供分离为不同的层,而 Medallion、Lambda 和 Kappa 等模式提供了不同的权衡。Databricks 的 Lakeflow、Delta Lake 和 Unity Catalog 被呈现为简化这些流程的工具,正朝着更灵活的 ELT 方向发展,而非传统的 ETL。
-
Databricks 为 AI 智能体、模型和数据推出 OpenSharing
Databricks 推出了 OpenSharing,这是其 Delta Sharing 协议为智能体 AI 时代进行的演进。这个新的开源协议现在由 Linux Foundation 托管,它将数据共享扩展到涵盖跨任何云或供应商的模型、智能体和技能。OpenSharing 旨在通过支持 Delta Lake、Apache Iceberg 和 Apache Parquet 等各种格式,实现无缝协作,让数据和 AI 资产保留在其原始位置。
-
Text-to-SQL LLM 风险:数据泄露和成本超支
Text-to-SQL 是一个已解决的问题的观念是一个危险的迷思,因为 LLM 会生成非确定性的 SQL 查询,对敏感数据构成风险。将整个模式馈送给 LLM 或使用语义代理层等方法可能导致数据损坏或上下文窗口限制等问题。一个更健壮的解决方案涉及一个“硬门控 SQL 沙盒”,它使用抽象语法树 (AST) 验证器在执行前检查生成的 SQL 是否存在未经授权的访问或连接,同时在数据库层面进行资源治理以防止过度的计算成本。
-
Databricks 实现跨引擎统一数据访问控制
Databricks 推出了其跨引擎 ABAC 功能的 Beta 版本,允许在 Unity Catalog 中一次性定义基于属性的访问控制,并跨各种外部数据引擎强制执行。这项新功能旨在通过在目录层集中管理策略来简化数据治理,避免在不同系统之间重复安全规则。该功能利用开放的 Iceberg REST Catalog API,使任何兼容的引擎都能将策略执行委托给 Unity Catalog,从而确保在数据访问到达查询引擎之前就受到控制。
-
AI 工作负载需要新的数据架构层
传统数据栈不足以应对现代 AI 工作负载,这些工作负载需要处理非结构化数据、实时嵌入和强大的 lineage 跟踪。文章提出了一个新的“Platinum”或原生 AI 层,扩展了 Medallion 架构,用于预先物化特征和为 AI 模型计算嵌入。这种方法从一开始就确保 AI 就绪,避免了痛苦的改造,并为 AI 预测提供了关键的可审计性。
-
Databricks 为 SQL 专业人士推出分析工程师学习路径
Databricks 推出了专为 SQL 从业者设计的新学习路径,旨在帮助他们成为分析工程师。该课程侧重于在 Databricks Lakehouse 平台内将原始数据转化为受管的、面向 AI 的语义模型和指标视图。该路径涵盖了数据建模、构建原生 SQL ETL 管道以及定义指标等基本技能,并提供自定进度和讲师指导两种课程形式。
-
Databricks 推出用于指导性操作的 AI 销售工具
Databricks 开发了 PipelineIQ,这是一款由 AI 驱动的销售智能工具,旨在超越传统的预测。PipelineIQ 不依赖于回顾性数据,而是分析混乱的 CRM 信息,为销售团队提供指导性的“下一步最佳行动”。该系统识别应加速、调整或取消优先级的交易,并提供清晰的理由和针对特定角色的指导。
-
Databricks 支持外部引擎写入 Unity Catalog 表
Databricks 推出了一个 Beta 功能,允许 Apache Spark、Flink 和 DuckDB 等外部引擎创建、读取和写入 Unity Catalog 管理的 Delta 表。此扩展基于 Unity Catalog 的开放 API,旨在消除数据孤岛并降低冗余存储成本。新功能利用 Delta Lake 的 catalog commits 来实现事务安全和可审计性,同时还支持流式操作和自动数据优化。
-
统一收入平台架构解决销售分析碎片化问题
本文提出了一个统一收入平台(URP)的四层架构,以解决B2B组织中销售分析的碎片化问题。该系统将CRM数据摄取、目标层叠、机器学习预测和基于角色的分析集成到一个平台中。通过在数据摄取、数据平台、财务规划和展示等不同层级分离关注点,URP旨在减少手动数据对账,并提供团队健康状况和绩效的整体视图。
-
Databricks MCP 让 AI 代理直接查询 Lakehouse 数据
Databricks 发布了一项名为 MCP 的集成,允许 Claude 和 Cursor 等 AI 代理直接访问和交互存储在 Databricks Lakehouse 中的数据。该工具使 AI 模型能够查询 Delta 表、执行笔记本、管理集群和检查数据沿袭,而不仅仅是访问文档。该集成旨在通过允许对话式命令在 Databricks 环境中触发操作,来简化数据分析、自动化和 MLOps 任务。