研究人员开发了Gleam,一个旨在实现局域网内跨设备高效GPU共享以进行AI推理的框架。Gleam通过实现自动模型权重缓存以减少带宽、异步执行以缓解频繁API调用的延迟,以及一个动态运行时任务调度器来根据网络状况和GPU争用情况优化API远程调用对,从而解决网络瓶颈。该系统还确保了跨分布式执行的CUDA上下文一致性。实验表明,Gleam在API远程调用效率和整体系统吞吐量方面显著优于现有方法,适用于各种AI工作负载和NVIDIA GPU。 AI
影响 通过利用分布式GPU,可能实现更广泛、更高效的消费级硬件AI推理。
排序理由 该项目是一篇研究论文,详细介绍了一个新的GPU共享框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →