Databricks Runtime
PulseAugur coverage of Databricks Runtime — every cluster mentioning Databricks Runtime across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Databricks 将原生向量搜索集成到 Databricks Runtime 中
Databricks 在其 Databricks Runtime 中引入了一项新的向量搜索功能,旨在优化面向批处理的向量搜索工作负载。此功能名为 NEAREST BY Join,将向量搜索作为一等 SQL 连接操作进行集成,利用 Photon 的深度内核优化和向量索引的开放存储格式。新方法旨在提高实体解析和数据丰富等任务的性能、可靠性和成本效益,超越了传统的实时单查询优化。
-
Databricks 为 Apache Spark 结构化流式处理启用按需状态重新分区
Databricks 推出了适用于 Apache Spark 结构化流式处理的按需状态重新分区功能,该功能在 Databricks Runtime 18 及更高版本中可用。此功能允许用户在不丢失累积状态的情况下调整有状态流式查询的分区数量,从而解决数据倾斜和性能下降的问题。Coveo 等早期采用者报告了显著的运营节省,包括 Amazon S3 API 成本降低 40%,这使他们能够随着需求的转移动态扩展基础设施。
-
Databricks 支持数据和 ML 工作负载的本地 IDE 开发
Databricks 增强了其 IDE 集成功能,允许开发人员直接从本地开发环境运行、调试和扩展工作负载。此次更新通过 SSH 隧道连接到 Databricks 计算,包括 Serverless 和 AI Runtime 集群。这些改进通过在本地 IDE 和 Databricks 工作空间之间同步项目文件和依赖项,同时为编码代理提供完整的工作空间上下文,从而简化了数据工程和机器学习的开发。
-
Databricks 自动升级在无需手动干预的情况下增强 Unity Catalog 表
Databricks 推出了自动升级(Auto Upgrades)这一新功能,旨在自动将最佳实践增强功能应用于 Unity Catalog 管理的表。该系统在启用行跟踪(Row Tracking)等功能之前会验证工作负载兼容性,旨在无需手动干预即可提高性能、可靠性和节省成本。自动升级会观察表访问模式,验证客户端和表兼容性,然后安全地应用更改,未来还计划将兼容性检查扩展到外部客户端。