一个团队为 Qwen3.6 35B-A3B 大型语言模型开发并开源了一个优化的内核,专门针对 AMD MI350X GPU。他们的基准测试结果显示,8 个 MI350X GPU 可以达到每秒超过 78,000 个输出 token 的吞吐量,这比 vLLM 的吞吐量高出一倍多。此举旨在提高 LLM 在 AMD 硬件上的性能,以应对目前 NVIDIA 因 CUDA 等更成熟的软件栈而在市场上占据主导地位的局面。 AI
影响 提升了 LLM 在 AMD 硬件上的性能,为 AI 工作负载提供了 NVIDIA GPU 的潜在竞争替代方案。
排序理由 该集群详细介绍了在特定硬件上针对特定 LLM 的开源软件优化,包括基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →