研究人员开发了一个名为REACT的系统,该系统解决了分布式训练期间共享AI集群中的拥塞问题。REACT在应用层运行,使用流统计信息实时检测网络拥塞,并动态调整通信集体模式。这种方法不需要特殊的网络基础设施支持,并且可以由单个用户部署。REACT被原型化为NCCL之上的一个Shim层,在共享学术GPU集群的拥塞情况下,通信性能提高了13%-38%,模拟显示在各种场景下可提高高达75%。 AI
影响 提高了共享AI集群中的通信性能,可能加速分布式训练。
排序理由 关于AI基础设施新系统的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →