实体
AllReduce
AllReduce
PulseAugur coverage of AllReduce — every cluster mentioning AllReduce across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的 T-CCL 库利用 TMA 提升多 GPU AI 模型性能
研究人员开发了 T-CCL,这是一个专为大型 Transformer 模型中高效多 GPU 执行而设计的新型集体通信库。T-CCL 利用张量内存加速器 (TMA) 来卸载数据移动和归约操作,显著减少了 GPU 流式多处理器 (SM) 上所需的计算资源。这种减少使得通信和计算能够更好地并发执行,从而提高性能。评估显示,在资源受限的条件下,T-CCL 的性能比 NCCL 等现有库高出 3.42 倍,并提高了 vLLM 等系统中的端到端推理吞吐量。
-
新的OptCC算法最大限度地减少了网络故障对AllReduce的拖慢
研究人员开发了OptCC,这是一种旨在提高大规模GPU集群中AllReduce操作效率的新算法,尤其是在发生网络故障时。该算法接近完成时间的理论下限,显著减少了现有容错方法通常会看到的性能下降。实验表明,即使由于网络问题导致带宽大幅损失,OptCC仍能保持接近最优的性能,优于当前最先进的方法。