PulseAugur
中
实时 03:49:22
实体 Delta Lake

Delta Lake

PulseAugur coverage of Delta Lake — every cluster mentioning Delta Lake across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
30
90 天内 30
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. TOOL · CL_286214 ·

    Databricks 通过新指南简化 dbt ETL 管道迁移

    Databricks 发布了一份指南,详细介绍了用户如何以最少的代码更改将 dbt ETL 管道迁移到 Databricks Lakehouse 平台。该过程包括更新 dbt 适配器和配置,解决细微的 SQL 方言差异,并利用 Lakeflow Jobs 等工具进行生产调度。这种方法允许增量迁移,从转换层开始,以逐个模型解锁成本节省并验证输出,然后再迁移数据堆栈的其他部分。

  2. TOOL · CL_282816 ·

    IFCO 使用 Databricks 和 dbt 优化数据管道,运行时长缩短 60%

    爱尔兰电影分类办公室 (IFCO) 利用 Databricks 和 dbt 优化了其管理大量可重复使用包装数据的管道。通过实施特定的 Delta Lake 写入行为和优化数据聚类,IFCO 将其核心语义层作业的运行时长显著缩短了 60% 以上,无需进行昂贵的夜间完全刷新。这种方法使 IFCO 能够高效处理数十亿的跟踪事件,并为其全球可重复使用包装池维护准确的 KPI。

  3. TOOL · CL_237943 ·

    Databricks 数据工程师考试 Delta Lake 概念详解

    本文旨在帮助读者理解 Delta Lake,这是准备 Databricks 数据工程师助理考试的关键组成部分。文章分解了 Delta Lake 的核心概念,旨在为读者提供认证所需的知识。

  4. TOOL · CL_237019 ·

    Microsoft Fabric 通过 OneLake 和 Azure OpenAI 实现企业级 RAG AI

    一种新方法允许使用 Microsoft Fabric 和 OneLake 创建企业级检索增强生成 (RAG) AI 系统,显著降低了基础设施的复杂性。该方法通过利用 OneLake 的统一数据湖和 Spark 引擎直接在 Delta Lake 表中生成和存储向量嵌入,从而绕过了对专用外部向量数据库的需求。该过程涉及使用 PySpark 和 Pandas UDFs 高效地批量处理到 Azure OpenAI 的 API 请求以进行向量化…

  5. TOOL · CL_233003 ·

    南方公司通过Databricks驱动的SCOUT应用程序增强风暴响应能力

    南方公司开发了SCOUT,这是一个构建在Databricks Lakehouse平台上的实时风暴运营应用程序。该应用程序将停电、客户和可靠性数据整合到一个统一视图中,增强了调度员、风暴中心领导和现场团队的决策能力。SCOUT因其在停电信息访问方面的变革性方法获得了2025年S.E.E.行业卓越奖,并被南方公司各运营业务的1100多名员工使用。

  6. TOOL · CL_232075 ·

    Databricks 项目组成部分详解:Spark、Delta Lake、MLflow

    本文分解了构成 Databricks 项目的核心组件和技术。文章强调了该平台的集成特性,重点介绍了 Apache Spark、Delta Lake 和 MLflow 等工具。解释涵盖了各种编程语言和开发环境,如 Python、R、Scala 和 Jupyter Notebooks,所有这些都在云基础设施中。

  7. TOOL · CL_226731 ·

    Databricks Knowledge Assistant 架构提升企业搜索能力

    Databricks 为其 Knowledge Assistant 开发了一种新架构,以提升企业搜索能力。该系统最初命名为 Instructed Retriever,后优化为 Instructed-Retriever-1,它通过使系统能够遵循复杂的指令(如排除和特定格式),而不仅仅是匹配关键词,从而解决了传统检索增强生成 (RAG) 的局限性。通过实现并行搜索而非顺序重试,进一步优化了速度,从而能够更快、更准确地响应复杂的用户查询。

  8. TOOL · CL_218628 ·

    开放表格式:Iceberg、Delta Lake 和 Hudi 详解

    开放表格式,如 Apache Iceberg、Delta Lake 和 Apache Hudi,对于数据湖至关重要,它们支持在对象存储中存储的数据上进行 ACID 事务、模式演进和时间旅行。这些格式将文件集合转化为可查询的表,弥合了数据湖和数据仓库之间的差距。Apache Iceberg 源自 Netflix,专注于大型、不断演进的表的高效元数据管理。Delta Lake 由 Databricks 开发,使用事务日志来实现 ACID …

  9. TOOL · CL_214112 ·

    数据聚类和 Z 排序通过实现数据跳过来优化表扫描

    一篇技术文章解释了 Z 排序和数据聚类,这些技术用于优化大型表中的数据检索,特别是在 Delta Lake 等系统中。文章强调了传统分区可能不足以应对,导致查询效率低下,扫描大量无关数据。文章详细介绍了文件级最小/最大统计数据如何实现数据跳过,这是通过避免不必要的文件读取来提高查询性能的关键机制。

  10. SIGNIFICANT · CL_197374 ·

    Amtrak 构建由 AI 驱动的数据主干以实现重大铁路转型

    Amtrak 正在实施一个名为 Rail Intelligence 的综合性数字智能平台,该平台基于 Databricks 构建,以支持其 50 多年来最重大的运营转型。该平台旨在将来自新列车组、预订系统和基础设施项目等各种来源的数据统一到一个单一的治理层中。目标是通过利用实时数据和机器学习模型,实现预测性维护,提高运营准备能力,并改进资本决策。

  11. TOOL · CL_188216 ·

    Databricks 在湖仓一体中推出用于多模态数据的原生 FILE 类型

    Databricks 推出了一项名为 FILE 类型的新测试版功能,旨在将文档、图像和视频等非结构化数据作为原生列存储在表中。这项创新旨在将多模态数据直接集成到湖仓一体中,使其能够与结构化数据一起进行查询、保护和管理。该公司正与社区合作,将 FILE 类型对 Apache Parquet 和 Delta Lake 的支持嵌入其中,以确保广泛的生态系统兼容性和数据可移植性。

  12. COMMENTARY · CL_183530 ·

    分析建议停止将 Databricks 模式复制到 Microsoft Fabric

    建议数据工程师避免在 Microsoft Fabric 中复制复杂的 Databricks 架构模式。文章认为,Fabric 的统一、无服务器和 SaaS 架构比 Azure Databricks 过去所需的复杂集群管理和优化技术更青睐简洁性。通过利用 OneLake 和其自动优化功能等 Fabric 的原生功能,团队可以减少技术债务,降低计算成本,并构建更强大的数据管道。

  13. TOOL · CL_170431 ·

    Databricks MCP 服务器授予 AI 代理直接访问 Lakehouse 的权限

    Databricks 发布了一款新工具 Databricks MCP 服务器,它允许 Claude 等 AI 代理直接访问和交互用户的数据 Lakehouse。此次集成支持对话式执行 Notebook、针对 Delta Lake 的 SQL 查询、计算资源管理以及数据沿袭和 MLflow 工件的检查。该工具旨在通过允许代理查询数据、检查作业状态和提取见解,而无需手动干预,从而简化数据分析和工程的 AI 工作流。

  14. TOOL · CL_155866 ·

    陶氏公司利用 Databricks 构建碳账本以追踪产品排放

    陶氏公司(Dow)已开发出碳足迹账本(Carbon Footprint Ledger, CFL),利用 Databricks 数据智能平台来简化其广泛产品组合的产品碳足迹(Product Carbon Footprints, PCFs)的计算。该系统构建在 Apache Spark 和 Delta Lake 等技术之上,将处理时间从数周大幅缩短至一小部分,同时确保数据沿袭和可审计性。CFL 的设计符合 ISO 14067 和 GHG …

  15. TOOL · CL_153291 ·

    机器学习和数据湖的数据版本控制工具评测

    本文对机器学习和数据湖的数据版本控制工具进行了实用性概述。文章考察了 Dolt、DVC、Delta Lake、Iceberg、Hudi 和 lakeFS 等平台,深入探讨了它们有效管理和分析数据的能力。本次评测旨在帮助用户了解在 MLOps 工作流中进行可靠数据版本控制的可用选项。

  16. TOOL · CL_140700 ·

    Databricks 实现外部引擎访问 Unity Catalog 管理表

    Databricks 宣布,外部引擎现已可在公共预览版中创建、读取和写入 Unity Catalog 管理的 Delta 表。此功能基于开放的 UC Delta API 构建,允许 Apache Spark、Apache Flink 和 DuckDB 等引擎访问和修改数据,并由 Unity Catalog 强制执行集中式治理。管理表还利用 Predictive Optimization 提高查询性能并降低存储成本,无需手动调优。

  17. TOOL · CL_114076 ·

    Azure、AWS、GCP 上的 MLOps CI/CD 和特征工程 · 跟踪 2 个来源

    该集群探讨了在 Azure、AWS 和 GCP 等主要云平台上实现 MLOps 中的 CI/CD 管道。它强调了 MLOps 与传统 DevOps 的区别,强调了特征工程和可扩展数据处理的重要性。Azure Databricks 结合 Apache Spark 和 Delta Lake 等技术,被认为是管理大规模特征工程和 MLOps 工作流的关键工具。

  18. COMMENTARY · CL_104219 ·

    数据湖与云数据仓库:选择正确的架构

    本指南比较了数据湖和云数据仓库架构,重点介绍了它们在数据存储、查询性能、治理和成本方面的差异。数据湖因其读时模式(schema-on-read)方法和低成本对象存储,非常适合存储用于机器学习和高级分析的原始、多格式数据。相反,云数据仓库针对结构化数据和用于商业智能的高并发SQL查询进行了优化,采用写时模式(schema-on-write)方法。数据湖仓(Data lakehouses)被提出为一种解决方案,它结合了两者优点,在数据湖存…

  19. TOOL · CL_95222 ·

    Databricks 概述统一数据管道架构,推出 Lakeflow

    Databricks 详细介绍了其数据管道架构方法,强调了一个整合批处理和流式数据处理的统一平台。该公司指出,有效架构将数据摄取、处理、存储和提供分离为不同的层,而 Medallion、Lambda 和 Kappa 等模式提供了不同的权衡。Databricks 的 Lakeflow、Delta Lake 和 Unity Catalog 被呈现为简化这些流程的工具,正朝着更灵活的 ELT 方向发展,而非传统的 ETL。

  20. RESEARCH · CL_95055 ·

    Databricks 为 AI 智能体、模型和数据推出 OpenSharing

    Databricks 推出了 OpenSharing,这是其 Delta Sharing 协议为智能体 AI 时代进行的演进。这个新的开源协议现在由 Linux Foundation 托管,它将数据共享扩展到涵盖跨任何云或供应商的模型、智能体和技能。OpenSharing 旨在通过支持 Delta Lake、Apache Iceberg 和 Apache Parquet 等各种格式,实现无缝协作,让数据和 AI 资产保留在其原始位置。