PulseAugur
中
实时 13:26:37
实体 Apache Iceberg

Apache Iceberg

PulseAugur coverage of Apache Iceberg — every cluster mentioning Apache Iceberg across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
19
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 22 条
  1. TOOL · CL_286214 ·

    Databricks 通过新指南简化 dbt ETL 管道迁移

    Databricks 发布了一份指南,详细介绍了用户如何以最少的代码更改将 dbt ETL 管道迁移到 Databricks Lakehouse 平台。该过程包括更新 dbt 适配器和配置,解决细微的 SQL 方言差异,并利用 Lakeflow Jobs 等工具进行生产调度。这种方法允许增量迁移,从转换层开始,以逐个模型解锁成本节省并验证输出,然后再迁移数据堆栈的其他部分。

  2. TOOL · CL_279511 ·

    Databricks 推出 API 以防止湖仓一体的目录锁定

    Databricks 推出了新的 REGISTER 和 UNREGISTER API,以增强湖仓一体架构内的数据可移植性。这些 API 允许在不同目录之间移动表,而无需复制数据或元数据,从而解决了目录锁定的挑战。 UNREGISTER 端点已贡献给 Apache Iceberg REST catalog 规范,它允许目录通过返回其元数据位置来放弃对表的管理,从而防止数据分叉并确保顺利过渡到新目录。

  3. TOOL · CL_274763 ·

    Databricks 为 Apache Iceberg 治理引入读取限制

    Databricks 为 Apache Iceberg 引入了新功能,专注于加强跨各种引擎的数据治理。更新包括读取限制和目录标签,旨在使治理策略更具可移植性和可执行性。读取限制标准化了目录如何将数据访问策略的执行委托给受信任的引擎,确保在读取数据时应用行和列限制。

  4. TOOL · CL_246920 ·

    Databricks 通过 Apache Iceberg 规范增强 Open Lakehouse 治理

    Databricks 推出了 Apache Iceberg 的新规范,重点关注读取限制和目录标签,以增强 Open Lakehouse 架构内的治理。这些进步旨在使数据治理像数据本身一样具有可移植性,允许在 Unity Catalog 中定义的策略跨 Apache Spark、DuckDB 和 Trino 等各种引擎得到一致执行。读取限制功能标准化了委托执行,使目录能够将行和列限制传递给受信任的引擎进行应用,从而简化了跨引擎数据访问和策略管理。

  5. TOOL · CL_218628 ·

    开放表格式:Iceberg、Delta Lake 和 Hudi 详解

    开放表格式,如 Apache Iceberg、Delta Lake 和 Apache Hudi,对于数据湖至关重要,它们支持在对象存储中存储的数据上进行 ACID 事务、模式演进和时间旅行。这些格式将文件集合转化为可查询的表,弥合了数据湖和数据仓库之间的差距。Apache Iceberg 源自 Netflix,专注于大型、不断演进的表的高效元数据管理。Delta Lake 由 Databricks 开发,使用事务日志来实现 ACID …

  6. TOOL · CL_214112 ·

    数据聚类和 Z 排序通过实现数据跳过来优化表扫描

    一篇技术文章解释了 Z 排序和数据聚类,这些技术用于优化大型表中的数据检索,特别是在 Delta Lake 等系统中。文章强调了传统分区可能不足以应对,导致查询效率低下,扫描大量无关数据。文章详细介绍了文件级最小/最大统计数据如何实现数据跳过,这是通过避免不必要的文件读取来提高查询性能的关键机制。

  7. TOOL · CL_193346 ·

    AI 预测 Lakehouse 表中的数据压缩效用

    研究人员开发了一种利用元数据预测 Lakehouse 表中数据压缩效用的方法。通过从清单文件中提取 17 个特征并训练 XGBoost 模型,他们在预测文件缩减率方面取得了高精度。研究发现,简单的阈值足以做出二元压缩决策,并且压缩有利于元数据密集型查询,同时可能减慢全扫描聚合。

  8. TOOL · CL_186957 ·

    新的 Lakehouse 方法通过文件剪枝增强向量搜索

    研究人员开发了一种新颖的方法,用于将近似最近邻 (ANN) 搜索与结构化数据过滤集成到开放 Lakehouse 表格式中,特别是 Apache Iceberg 之上的 Parquet。该方法利用 Lakehouse 现有的文件剪枝功能,如分区剪枝和区域图 (zone-maps),首先减少需要搜索的数据文件数量。IVF 索引嵌入在每个 Parquet 文件的页脚中,允许在过滤后对剩余文件进行高效的每文件 ANN 搜索。这种组合显著加快了…

  9. TOOL · CL_140700 ·

    Databricks 实现外部引擎访问 Unity Catalog 管理表

    Databricks 宣布,外部引擎现已可在公共预览版中创建、读取和写入 Unity Catalog 管理的 Delta 表。此功能基于开放的 UC Delta API 构建,允许 Apache Spark、Apache Flink 和 DuckDB 等引擎访问和修改数据,并由 Unity Catalog 强制执行集中式治理。管理表还利用 Predictive Optimization 提高查询性能并降低存储成本,无需手动调优。

  10. TOOL · CL_130284 ·

    Couchbase 为生产 AI Agent 发布 AI Data Plane

    Couchbase 推出了其 AI Data Plane,旨在作为生产环境中 AI Agent 的运行数据层。该新产品包括持久化 Agent Memory、用于工具发现的 Agent Catalog 以及企业 MCP 服务器等功能。此外,它还在 Enterprise Analytics 2.2 中整合了 Apache Iceberg lakehouse 联邦功能,以满足 IDC Devin Pratt 所识别的 80% Agentic…

  11. TOOL · CL_98909 ·

    pgEdge 推出 ColdFront,用于 S3 中可查询的 PostgreSQL 数据

    pgEdge 推出了 ColdFront,这是一款旨在将 PostgreSQL 数据迁移到 S3 的新工具,同时保持其可查询性和可更新性。该解决方案旨在通过允许将大型数据集像本地数据一样进行查询,而无需更改现有应用程序代码,来解决管理大型数据集的挑战。该工具利用 Apache Iceberg 实现其功能。

  12. RESEARCH · CL_95055 ·

    Databricks 为 AI 智能体、模型和数据推出 OpenSharing

    Databricks 推出了 OpenSharing,这是其 Delta Sharing 协议为智能体 AI 时代进行的演进。这个新的开源协议现在由 Linux Foundation 托管,它将数据共享扩展到涵盖跨任何云或供应商的模型、智能体和技能。OpenSharing 旨在通过支持 Delta Lake、Apache Iceberg 和 Apache Parquet 等各种格式,实现无缝协作,让数据和 AI 资产保留在其原始位置。

  13. TOOL · CL_69596 ·

    Databricks 实现跨引擎统一数据访问控制

    Databricks 推出了其跨引擎 ABAC 功能的 Beta 版本,允许在 Unity Catalog 中一次性定义基于属性的访问控制,并跨各种外部数据引擎强制执行。这项新功能旨在通过在目录层集中管理策略来简化数据治理,避免在不同系统之间重复安全规则。该功能利用开放的 Iceberg REST Catalog API,使任何兼容的引擎都能将策略执行委托给 Unity Catalog,从而确保在数据访问到达查询引擎之前就受到控制。

  14. RESEARCH · CL_57980 ·

    Databricks Unity Catalog 通过新功能增强对 Apache Iceberg 的支持

    Databricks 增强了其 Unity Catalog,为流行的开源表格式 Apache Iceberg 提供全面支持。主要更新包括托管 Iceberg、Iceberg v3 和外部 Iceberg 的通用可用性 (GA),以及跨引擎访问控制和零拷贝安全共享等新功能。这些进步旨在统一跨不同引擎和系统的数据治理和性能,为 Iceberg v4 和 Delta 5.0 在统一元数据结构上的融合铺平道路。

  15. TOOL · CL_51713 ·

    AI 工作负载需要新的数据架构层

    传统数据栈不足以应对现代 AI 工作负载,这些工作负载需要处理非结构化数据、实时嵌入和强大的 lineage 跟踪。文章提出了一个新的“Platinum”或原生 AI 层,扩展了 Medallion 架构,用于预先物化特征和为 AI 模型计算嵌入。这种方法从一开始就确保 AI 就绪,避免了痛苦的改造,并为 AI 预测提供了关键的可审计性。

  16. TOOL · CL_39208 ·

    SageMaker Feature Store 增加了 Lake Formation 和 Iceberg 支持

    Amazon SageMaker Feature Store 推出了增强 ML 功能管道的新功能。这些更新包括与 AWS Lake Formation 的原生集成,用于细粒度访问控制,以及新的 Apache Iceberg 表属性,用于管理元数据累积和降低存储成本。这些增强功能可通过 SageMaker Python SDK v3.8.0 获得,旨在简化机器学习操作的功能数据管理和成本可预测性。

  17. RESEARCH · CL_33512 ·

    AWS 将定制的 Graviton 芯片集成到 Redshift 分析堆栈中

    Amazon Web Services 为其 Redshift 数据仓库服务推出了新的 Graviton 驱动的 RG 实例。这些实例集成了数据仓库和数据湖分析,旨在提高 AI 时代数据基础设施的性能并降低成本。AWS 指出,与前几代产品相比,数据仓库性能最高可提高 2.2 倍,Apache Iceberg 性能最高可提高 2.4 倍,同时还降低了成本。

  18. TOOL · CL_20675 ·

    DuckDB Labs 发布了新的数据湖格式 DuckLake 1.0

    DuckDB Labs 推出了 DuckLake 1.0,这是一种新的数据湖格式,旨在将表元数据存储在 SQL 数据库中。这种方法与将元数据分散在对象存储文件中的传统方法形成对比。关键改进包括存储在目录中的小更新、增强的排序和分区功能以及与 Apache Iceberg 功能的兼容性。

  19. SIGNIFICANT · CL_14895 ·

    SAP 收购 Dremio 和 Prior Labs 以增强其 AI 就绪数据平台

    SAP 收购了数据湖仓提供商 Dremio,以增强其数据分析和 AI 能力。此举旨在统一企业内外部数据,为大规模 AI 代理提供支持。此次收购凸显了 SAP 致力于利用 Apache Iceberg 等开放表格式的承诺,并可能改变其以往的合作策略。

  20. TOOL · CL_32004 ·

    Amazon Quick 通过文档控制和基于提示的仪表板增强 AI 分析

    Amazon Quick,一项由 AI 驱动的分析服务,已推出多项新功能以增强数据访问和可用性。现在支持 Amazon S3 知识库的文档级访问控制列表 (ACL),允许进行细粒度权限设置以限制敏感文档。此外,Amazon Athena 的跨账户访问允许查询不同 AWS 账户中的数据,同时计费仍由数据所有者承担。该服务现在还允许用户通过自然语言提示生成整个仪表板,从而简化了分析过程。