PulseAugur
实时 10:26:59

DynaResize 系统优化 LLM 训练后 GPU 分配

研究人员开发了 DynaResize 系统,旨在优化大型语言模型 (LLM) 训练后阶段的 GPU 资源分配。该系统动态地在滚动和训练阶段之间重新分配 GPU,以缓解由长尾滚动延迟引起的流水线气泡。DynaResize 通过将重塑分解为细粒度操作并采用通信器重用和滞后重塑等技术来实现这一点,与静态配置相比,在吞吐量方面取得了显著的改进,并减少了执行时间。 AI

影响 优化 LLM 训练的 GPU 利用率,可能降低成本并加速开发周期。

排序理由 该集群描述了一篇研究论文,详细介绍了一个用于优化 LLM 训练基础设施的新系统。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DynaResize 系统优化 LLM 训练后 GPU 分配

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hanlin Du, Zhiyuan Yan, Haiquan Chen, Jiarui Fang, Yungang Bao, Sa wang ·

    DynaResize:用于解耦大模型训练后推理的运行时 GPU 重分配

    arXiv:2607.22614v1 Announce Type: new Abstract: RL-based LLM post-training increasingly disaggregates Rollout and Training across separate GPU resources, but static GPU partitioning suffers from severe pipeline bubbles under long-tail rollout latency. We present DynaResize, a run…