PulseAugur
实时 15:18:02
实体 Apache Parquet

Apache Parquet

PulseAugur coverage of Apache Parquet — every cluster mentioning Apache Parquet across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 15 条
  1. TOOL · CL_188216 ·

    Databricks 在湖仓一体中推出用于多模态数据的原生 FILE 类型

    Databricks 推出了一项名为 FILE 类型的新测试版功能,旨在将文档、图像和视频等非结构化数据作为原生列存储在表中。这项创新旨在将多模态数据直接集成到湖仓一体中,使其能够与结构化数据一起进行查询、保护和管理。该公司正与社区合作,将 FILE 类型对 Apache Parquet 和 Delta Lake 的支持嵌入其中,以确保广泛的生态系统兼容性和数据可移植性。

  2. TOOL · CL_186957 ·

    新的 Lakehouse 方法通过文件剪枝增强向量搜索

    研究人员开发了一种新颖的方法,用于将近似最近邻 (ANN) 搜索与结构化数据过滤集成到开放 Lakehouse 表格式中,特别是 Apache Iceberg 之上的 Parquet。该方法利用 Lakehouse 现有的文件剪枝功能,如分区剪枝和区域图 (zone-maps),首先减少需要搜索的数据文件数量。IVF 索引嵌入在每个 Parquet 文件的页脚中,允许在过滤后对剩余文件进行高效的每文件 ANN 搜索。这种组合显著加快了…

  3. COMMENTARY · CL_183864 ·

    AI应用探索:安全分析、开发与文档

    Qiita上的几篇文章讨论了AI在各种技术场景中的应用。一篇文章详细介绍了对利用SOCKS代理的攻击的观察和AI驱动的分析。另一篇文章探讨了一种“粗略的AI驱动开发”方法,并提到了ClaudeCode。第三篇文章提供了使用Copilot通过复制粘贴提示来解决工作中“未知问题”的实用指南,特别针对专业人士。最后,有一篇文章涵盖了将Oracle Database手册和文档在对象存储中归档为Parquet格式,同时也提到了AI的视角。

  4. TOOL · CL_181998 ·

    Microsoft Fabric Warehouses 引入“时间旅行”功能以恢复数据

    Microsoft Fabric Warehouses 现在提供“时间旅行”功能,允许用户查询数据在特定过去时间点的状态。此功能由底层的 Delta 存储架构实现,该架构使用不可变的 Parquet 文件和事务日志。当数据被更新或删除时,会创建新的 Parquet 文件,并且事务日志会记录这些更改,而不会立即删除旧文件。这会保留历史数据,使用户无需进行完整的数据库还原即可恢复到之前的状态并查询几分钟、几小时或几天前的数据。

  5. TOOL · CL_179341 ·

    Databricks 使 Variant 数据类型正式可用,以加快数据摄取速度

    Databricks 宣布其 Variant 数据类型现已正式可用,旨在改进半结构化数据的摄取和查询。此功能与 Variant Shredding 一起,使用预测性优化来提高查询性能,与将数据存储为字符串相比,读取速度提高了 30 倍。已有超过 5,000 个团队使用 Variant 来摄取来自各种数据库的流式事件、API 负载和无模式数据,从而消除了数据模式化的前期成本。

  6. TOOL · CL_178192 ·

    AI 团队使用 DuckDB、Polars 和 Parquet 简化数据管道

    本文详细介绍了 AI 团队如何采用更高效的数据管道架构。它强调了使用 DuckDB、Polars 和 Apache Parquet 作为构建更快、更简单的数据处理系统的关键组件。该方法旨在取代传统的、更复杂的 ETL(提取、转换、加载)堆栈。

  7. COMMENTARY · CL_161959 ·

    Apache Arrow 和 Parquet:为数据工程师解释列式存储

    本文通过数据工程师 Joey 和 Chandler 之间的虚构对话,阐述了 Apache Arrow 和 Apache Parquet 在大规模数据处理中的优势。Chandler 解释说,对于需要列数据的分析查询而言,基于行的存储效率低下,并将其与针对此类任务进行了优化的列式存储进行了对比。对话强调了 Python 列表和 Pandas 在内存占用和数据类型解释问题方面可能很耗费资源,因此与 Parquet 等列式格式相比,它们不适合…

  8. TOOL · CL_149622 ·

    Apache Spark Catalyst 优化器:内部机制与性能陷阱

    本文深入探讨了 Apache Spark Catalyst 优化器的内部工作原理,解释了 SQL 查询和 DataFrame 调用如何被转化为高效的物理执行计划。文章重点介绍了一个实际案例,其中一个看似微小的改动——将分区列包装在 Python UDF 中——导致 Spark 读取了比必要多 1500 倍的数据。解释侧重于 Catalyst 的树转换框架及其四个阶段的管道:分析、逻辑优化、物理规划和代码生成,并强调理解这些阶段对于优化…

  9. TOOL · CL_149623 ·

    Apache Spark 查询分解导致昂贵的数据重新计算

    Apache Spark 中的一个常见陷阱是由于惰性求值以及 Spark 分解查询的方式而意外地重新计算数据。单个 `df.count()` 操作,如果在 `.write()` 等操作之前执行且未缓存 DataFrame,则会触发数据沿袭的完全重新执行。这是因为 Spark 将 DataFrame 视为配方而不是已物化的结果,如果不小心管理,会导致多次扫描大型数据集。理解 Spark 的作业、阶段和任务的三级层次结构对于优化性能和避免…

  10. COMMENTARY · CL_142342 ·

    AI 技术栈、数据分析和多模态嵌入的探讨

    这个来自 Qiita 的文章集锦,在 Mastodon 上分享,探讨了各种 AI 应用和技术栈。一篇文章讨论了使用 TypeScript 作为 AI 代码生成的主要语言,并辅以 Python 和 Go 来处理特定任务。另一篇文章深入探讨了使用 Oracle Autonomous AI Lakehouse 在 Amazon S3 上分析大型日志数据,详细介绍了外部表、Parquet、SQL、Vector Search 和 RAG 的使用…

  11. RESEARCH · CL_95055 ·

    Databricks 为 AI 智能体、模型和数据推出 OpenSharing

    Databricks 推出了 OpenSharing,这是其 Delta Sharing 协议为智能体 AI 时代进行的演进。这个新的开源协议现在由 Linux Foundation 托管,它将数据共享扩展到涵盖跨任何云或供应商的模型、智能体和技能。OpenSharing 旨在通过支持 Delta Lake、Apache Iceberg 和 Apache Parquet 等各种格式,实现无缝协作,让数据和 AI 资产保留在其原始位置。

  12. RESEARCH · CL_68207 ·

    MLSkip 通过轻量级元数据改进数据库过滤

    研究人员开发了 MLSkip,一种用于改进数据库中机器学习过滤数据跳过的创新技术。传统方法对于过滤谓词中昂贵的黑盒机器学习模型无效。MLSkip 利用 Parquet 的 min-max 元数据和神经网络验证来修剪不符合条件的数​​据组,有效性高达 38.31%。该方法在 DuckDB 中比 PyTorch 实现了 1.07 倍的端到端加速。

  13. TOOL · CL_52181 ·

    Java 解析器 Hardwood 通过 AI 提升 Apache Parquet 速度

    Gunnar Morling,以 1 Billion Row Challenge 闻名,发布了 Hardwood,一个用于 Apache Parquet 的新 Java 解析器。该解析器设计为零依赖且超快,利用 Java 虚拟线程进行页级并行处理,以优化 CPU 核心使用和并发。Morling 强调,该解析器是在 AI 辅助下构建的,这加快了开发速度,但他同时强调了人类监督对于保持代码质量和防止回归至关重要。

  14. RESEARCH · CL_33512 ·

    AWS 将定制的 Graviton 芯片集成到 Redshift 分析堆栈中

    Amazon Web Services 为其 Redshift 数据仓库服务推出了新的 Graviton 驱动的 RG 实例。这些实例集成了数据仓库和数据湖分析,旨在提高 AI 时代数据基础设施的性能并降低成本。AWS 指出,与前几代产品相比,数据仓库性能最高可提高 2.2 倍,Apache Iceberg 性能最高可提高 2.4 倍,同时还降低了成本。

  15. RESEARCH · CL_11686 ·

    OptimusKG:新的多模态生物医学图谱整合了多样化的生命科学数据

    研究人员开发了 OptimusKG,一个新颖的多模态知识图谱,旨在整合多样化的生物医学数据。该图谱整合了结构化和半结构化资源,涵盖分子、解剖、临床和环境信息。OptimusKG 包含超过 190,000 个节点和 2100 万条边,保留了详细的元数据和来源信息。其有效性通过 PaperQA3 代理进行了评估,该代理确认了图谱中大部分关系都有文献支持。