Anyscale 为其 Ray Data 框架推出了 Shuffle V2,这是对其 shuffle 引擎的一次重大重新设计。新版本通过将 shuffle 中间结果物化到对象存储中,而不是累积在长生命周期的聚合器 actor 中,解决了 Shuffle V1 的局限性。这一改变增强了稳定性,允许数据在内存满时溢出到磁盘,并通过使引擎能够同时运行更多任务来提高可扩展性。此外,Shuffle V2 还引入了诸如向量化聚合和跨 shuffle 边界融合等优化,以提高效率。 AI
影响 增强了 AI/ML 流水线的数据处理能力,可能加速训练和推理。
排序理由 对现有数据处理框架组件的更新。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →