一个名为Tessera的新系统已被开发出来,以提高在异构GPU集群上运行大型AI模型的性能和成本效益。与之前在粗粒度级别运行的方法不同,Tessera在内核级别分解工作负载,认识到不同的内核具有不同的资源需求。这种方法可以更精确地将计算与硬件能力对齐,从而在服务吞吐量和成本效益方面取得显著改进。Tessera还展示了对新模型架构的泛化能力,甚至可以在更低的成本下超越同构GPU设置。 AI
影响 优化异构硬件上的AI模型服务,可能降低推理成本并提高吞吐量。
排序理由 该集群包含一篇研究论文,详细介绍了用于优化异构GPU上AI工作负载的新系统。
- arXiv
- graphics processing unit
- Parallel Thread Execution
- tessera
- Tiancheng Hu
- CoLab
- CUDA
- Cutileiro
- Flash Attention
- Gelu
- NVIDIA
- PyTorch
- TileGym
- Triton
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →