PulseAugur
实时 09:52:07
English(EN) MLCC: A Congestion Control Technique to Accelerate ML Training

新的MLCC技术将DNN训练速度提高了2.7倍

研究人员开发了MLCC,一种旨在加速共享GPU集群中深度神经网络(DNN)训练的新型拥塞控制技术。MLCC通过允许DNN训练流调整其发送速率,以便在计算期间与其他通信交错进行。该方法只需要对现有协议进行最少的代码更改,并已在作业完成时间方面取得了显著改进,平均和99百分位训练迭代时间分别减少了高达1.9倍和2.7倍。模拟还表明,在大型Fat-tree拓扑上训练吞吐量增加了1.35倍。 AI

影响 有潜力显著缩短训练时间并提高共享GPU环境中的资源利用率。

排序理由 详细介绍加速机器学习训练新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MLCC技术将DNN训练速度提高了2.7倍

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Anton A. Zabreyko, Sanjoli Narang, Sudarsanan Rajasekaran, Manya Ghobadi ·

    MLCC:一种加速机器学习训练的拥塞控制技术

    arXiv:2402.09589v2 Announce Type: replace-cross Abstract: We present MLCC, a novel technique to augment today's congestion control algorithms to accelerate DNN training jobs in shared GPU clusters in a fully distributed manner. At the heart of MLCC lies a straightforward principl…