研究人员开发了 AEGIS,一个运行时调度系统,旨在提高共享多 GPU 服务器上深度学习训练的效率。AEGIS 通过集成内存可行性检查、放置后观察和运行时压力过滤来管理多个深度学习工作负载的共置。与独占分配相比,这种方法旨在减少资源利用不足和排队时间,同时还能减轻不太复杂的共置方法可能出现的性能下降和内存不足故障。使用各种工作负载进行的评估表明,与独占分配相比,AEGIS 可将训练完成时间最多缩短 27%,与 Lucid 和 Horus 等其他共置系统相比,可缩短 16-21%。 AI
影响 优化深度学习训练的 GPU 利用率,可能降低成本并加速开发周期。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一个用于优化深度学习训练基础设施的新系统。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →