研究人员开发了 DynaResize 系统,旨在优化大型语言模型 (LLM) 训练后阶段的 GPU 资源分配。该系统动态地在滚动和训练阶段之间重新分配 GPU,以缓解由长尾滚动延迟引起的流水线气泡。DynaResize 通过将重塑分解为细粒度操作并采用通信器重用和滞后重塑等技术来实现这一点,与静态配置相比,在吞吐量方面取得了显著的改进,并减少了执行时间。 AI
影响 优化 LLM 训练的 GPU 利用率,可能降低成本并加速开发周期。
排序理由 该集群描述了一篇研究论文,详细介绍了一个用于优化 LLM 训练基础设施的新系统。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →