Apache Spark
PulseAugur coverage of Apache Spark — every cluster mentioning Apache Spark across labs, papers, and developer communities, ranked by signal.
- 2026-10-07 product_launch Unity announced the launch of Spark, a new no-code game creation tool. 来源
- 2026-07-21 product_launch Apache Spark released version 4.2, focusing on improved AI developer friendliness. 来源
- 2026-07-15 product_launch Databricks released Apache Spark 4.2, enhancing its data and AI capabilities. 来源
- 2026-07-01 product_launch Google launched its new Mac AI agent, Spark, available to Ultra subscribers. 来源
- 2026-06-03 product_launch Databricks announced a new real-time mode for Apache Spark, enhancing its capabilities for gaming sessionization. 来源
14 天有情绪数据
-
科学家竞相在AI解决之前发布数学证明
三位计算机科学家发表了一项重要的数学证明,赶在人工智能取得相同成就之前完成。这一进展凸显了人工智能在复杂问题解决领域日益加快的速度。研究人员的工作解决了他们领域的一个重大挑战,展示了人类在快速发展的人工智能能力面前的创造力。
-
Unity Spark 的 AI 游戏创建者预告片引来嘲笑
Unity Technologies 推出了 Unity Spark,这是一款专为没有游戏开发经验的用户设计的、由 AI 驱动的游戏创建工具。该工具允许用户用简单的语言描述他们想要的游戏,AI 将生成素材和基本的游戏机制。然而,Spark 的宣传预告片因其过于简单的演示而受到广泛批评,批评者认为这突显了使用 AI 进行游戏开发的局限性和潜在的尴尬之处,而不是展示真正的创意潜力。
-
Unity 推出 Spark,一款由 AI 驱动的无代码游戏创作工具
Unity 发布了 Spark,一款新的无代码工具,旨在通过 AI 驱动的提示来创建游戏。该平台将允许用户在基于 Web 的编辑器中协作进行游戏开发、发布他们的创作并进行游戏。Spark 将集成来自 Unity Asset Store 的资源,并将很快进入封闭测试。
-
新研究解决了大规模电子商务机器学习中的概念漂移检测问题
一篇新研究论文探讨了在大规模电子商务机器学习运营中检测概念漂移的方法。该研究评估了五种多变量双样本漂移检测器,发现基于 Apache Spark 的分布式最大均值差异(Maximum Mean Discrepancy)结合随机傅里叶特征(Random Fourier Features)具有良好的可扩展性。相比之下,逐维柯尔莫哥洛夫-斯米尔诺夫检验(Kolmogorov-Smirnov test)由于高基数特征的统计饱和问题而显得不适用…
-
Spark Datasets 因阻碍数据剪枝而使作业运行时长增加两倍
最近的一项分析强调了在 Apache Spark 中从 DataFrames 迁移到 Datasets 进行类型安全重构时,性能显著下降的问题。作者详细介绍了一个具体案例,其中在切换到 Dataset API 后,一个日常的数据丰富作业的运行时间增加了两倍,读取的数据量激增了 800% 以上。这种性能下降归因于 Spark 将 RDD 和 DataFrames 视为不同的执行世界,其中 Dataset API 的编译时安全性可能会无意…
-
AWS 大语言模型部署:SageMaker vLLM 对比 Bedrock 开源模型
在 AWS 上部署开源大语言模型(LLMs)涉及的复杂性超出了初始设置,尤其是在基础设施所有权和性能扩展方面。本文对比了两种 AWS 方法:一种是使用 vLLM 的 Amazon SageMaker,以获得对服务层的更大控制权;另一种是使用 Amazon Bedrock,以获得更受管理的体验。使用 vLLM 的 SageMaker 方法提供了对计算、推理引擎和配置的细粒度控制,适用于模型和推理性能至关重要的应用程序。然而,这种控制需要…
-
Databricks 将原生向量搜索集成到 Databricks Runtime 中
Databricks 在其 Databricks Runtime 中引入了一项新的向量搜索功能,旨在优化面向批处理的向量搜索工作负载。此功能名为 NEAREST BY Join,将向量搜索作为一等 SQL 连接操作进行集成,利用 Photon 的深度内核优化和向量索引的开放存储格式。新方法旨在提高实体解析和数据丰富等任务的性能、可靠性和成本效益,超越了传统的实时单查询优化。
-
NVIDIA DGX Spark定价被批评为“毒贩行为”
一位Reddit用户批评NVIDIA的DGX Spark变体定价策略,将以几乎与原版128GB版本相同的价格出售64GB型号的行为比作非法毒品交易的手段。该用户建议为容量较小的型号起一个新绰号,并引用了电视剧《火线》中的一个角色。
-
Microsoft Fabric Notebooks 通过高并发模式提升 Spark 性能
Microsoft Fabric Notebooks 推出了高并发模式,旨在显著减少数据工程工作流的集群初始化延迟。此功能允许多个 Notebook 连接到单个、预先初始化的 Spark 会话,从而将执行时间从几分钟缩短到几秒钟。通过启用此模式,组织可以优化其计算资源利用率并降低管道延迟。
-
Databricks 推出 API 以防止湖仓一体的目录锁定
Databricks 推出了新的 REGISTER 和 UNREGISTER API,以增强湖仓一体架构内的数据可移植性。这些 API 允许在不同目录之间移动表,而无需复制数据或元数据,从而解决了目录锁定的挑战。 UNREGISTER 端点已贡献给 Apache Iceberg REST catalog 规范,它允许目录通过返回其元数据位置来放弃对表的管理,从而防止数据分叉并确保顺利过渡到新目录。
-
Nvidia Spark 价格飙升促使用户寻找替代品
Reddit 的 r/LocalLLaMA 子版块上一名用户正在寻找 Nvidia Spark 的替代品,理由是近期 30% 的价格上涨使其硬件变得负担不起。该用户对不断上涨的成本和漫长的等待时间表示沮丧,并表示希望在 2028 年之前就开始从事 AI 工作。
-
Databricks 为 Apache Iceberg 治理引入读取限制
Databricks 为 Apache Iceberg 引入了新功能,专注于加强跨各种引擎的数据治理。更新包括读取限制和目录标签,旨在使治理策略更具可移植性和可执行性。读取限制标准化了目录如何将数据访问策略的执行委托给受信任的引擎,确保在读取数据时应用行和列限制。
-
Databricks Unity Catalog 强调用户对数据存储的控制权
Databricks 详细介绍了其在 Unity Catalog 中管理数据存储的策略,强调用户控制和开放格式。该平台允许用户将托管表数据存储在他们自己的云存储账户中,例如 Amazon S3、ADLs 或 Google Cloud Storage,从而确保数据所有权和可见性。Unity Catalog 支持 Iceberg 和 Delta 格式,可自动进行数据布局、调优和清理,同时允许 Apache Spark、Flink、Trin…
-
Microsoft Fabric 用户可以管理自定义 Python 环境以避免依赖问题
Microsoft Fabric 的默认 Spark 运行时足以应对基本数据任务,但对于高级数据科学和机器学习项目,它可能导致“依赖地狱”。当平台更新破坏已验证的模型或阻止使用新版库时,就会发生这种情况。为确保可重复性、稳定性和成本效益,至关重要的是通过在 Fabric 内的工作区或项目级别管理自定义 Python 环境,将项目特定的依赖项与默认运行时分离。
-
Micron 发布 512GB DDR5-9200 服务器内存模块
Micron 推出了新的 512GB DDR5-9200 内存模块,专为内存密集型服务器应用而设计。这些模块通过垂直堆叠 DRAM 芯片,与之前的配置相比,显著提高了能效,每个模块的功耗降低了 60% 以上。虽然三星此前已发布 512GB DDR5 RDIMM,但 Micron 的产品是首款在标准电压下实现 9200 MT/s 数据传输速率的产品。这些模块适用于分析、内存数据库和 agentic AI 等工作负载,并在特定应用中显示出…
-
Meta 延迟发布 Muse Spark 模型权重
Meta 尚未发布其 Muse Spark 模型的权重,尽管承诺在一个多月前发布。该模型原定于 8 月份发布,与 Spark 1.2 版本同步,但已被推迟。用户们正在质疑 Meta 是否会发布旧的权重还是等待新版本,特别是考虑到 Mark Zuckerberg 的评论强调需要快速发布模型以在全球竞争。此次延迟尤其引人注目,因为据报道中国的 AI 模型是开源的,这造成了一种竞争态势。
-
新的 SPARK 框架通过修复 KV 内存来增强 VLM 的安全性
研究人员开发了 SPARK,一个新颖的框架,旨在通过解决其多模态键值(KV)内存中的漏洞来增强视觉语言模型(VLM)的安全性。这种两阶段方法可以在不改变模型核心参数的情况下,识别并减轻嵌入文本和图像表示中的有害内容。SPARK 已在 LLaVA-OneVision-7B 和 Qwen2-VL-7B 等多个领先的 VLM 上成功减少了越狱攻击,同时在通用能力和语言质量基准上保持了高性能。
-
Databricks 为 Apache Spark 结构化流式处理启用按需状态重新分区
Databricks 推出了适用于 Apache Spark 结构化流式处理的按需状态重新分区功能,该功能在 Databricks Runtime 18 及更高版本中可用。此功能允许用户在不丢失累积状态的情况下调整有状态流式查询的分区数量,从而解决数据倾斜和性能下降的问题。Coveo 等早期采用者报告了显著的运营节省,包括 Amazon S3 API 成本降低 40%,这使他们能够随着需求的转移动态扩展基础设施。
-
用户就DeepSeek 4.1 Flash的NVIDIA DGX Spark集群大小寻求建议
一位Reddit r/LocalLLaMA板块的用户正在就购买第三台NVIDIA DGX Spark系统寻求建议。用户正在询问DeepSeek 4.1 Flash模型是否可以在双节点集群上有效运行,或者是否需要三节点或四节点配置。讨论围绕着在较小集群规模上优化模型性能的可行性展开。
-
Databricks 通过 Apache Iceberg 规范增强 Open Lakehouse 治理
Databricks 推出了 Apache Iceberg 的新规范,重点关注读取限制和目录标签,以增强 Open Lakehouse 架构内的治理。这些进步旨在使数据治理像数据本身一样具有可移植性,允许在 Unity Catalog 中定义的策略跨 Apache Spark、DuckDB 和 Trino 等各种引擎得到一致执行。读取限制功能标准化了委托执行,使目录能够将行和列限制传递给受信任的引擎进行应用,从而简化了跨引擎数据访问和策略管理。