艾伦人工智能研究所 (Ai2) 的人工智能基础设施团队开发了一个新的 GPU 集群调度系统,以提高资源分配的影响力。该系统取代了存在问题的基于优先级的调度器,引入了 GPU 时间预算和分层公平共享分配等功能。该团队管理着数千个 NVIDIA H100 和 B200 GPU,用于大规模人工智能模型训练,面临着供不应求 2-3 倍的需求。新方法旨在通过将资源分配从逐案协商转变为透明的预算流程,来解决 GPU 占用和优先级膨胀等问题。 AI
影响 优化 GPU 集群调度,确保高价值人工智能研究工作负载获得优先处理,从而可能加速科学发现。
排序理由 该项目详细介绍了一个由人工智能研究机构开发的 GPU 集群新调度系统,这是一项以研究为重点的基础设施改进。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →