实体
all-gather
all-gather
PulseAugur coverage of all-gather — every cluster mentioning all-gather across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
SwiftQK 通过高效的张量并行优化大型语言模型训练
研究人员开发了 SwiftQK,一种用于优化大型语言模型(使用张量并行训练)中查询-键归一化(QK-Norm)的新方法。该技术通过仅交换标量归一化统计数据并使计算与数据归约重叠,显著降低了与 QK-Norm 相关的通信开销。与现有方法相比,SwiftQK 在延迟和端到端服务性能方面均取得了实质性改进。
-
ZipCCL 和 FlashOverlap 等新技术通过优化通信加速 LLM 训练
研究人员开发了 ZipCCL,一个无损压缩库,旨在通过解决通信瓶颈来加速大型语言模型的分布式训练。该库利用了针对 LLM 张量分布和 GPU 优化压缩内核的指数编码等新颖技术。在 64-GPU 集群上的评估表明,ZipCCL 可以将通信时间减少高达 1.35 倍,并实现 1.18 倍的整体训练加速,而不会损害模型质量。另外,另一项研究工作引入了 FlashOverlap,一种通过用分解的点对点通信替换集体操作来最小化分布式 LLM 训…