AMD 的 MI355X 图形卡在 Kimi K2.5 模型的 vLLM 基准测试中表现优于 Nvidia 的 B200,这是社区开发的内核驱动的重大成就。这一进步源于 AMD 和 GPU_MODE 组织的一项价值 110 万美元的内核黑客马拉松,通过在 MoE、Top-K 和张量并行内核方面的优化,使 MI355X 的端到端性能提高了 4 倍以上。虽然 AMD 在 Kimi 模型上的 vLLM 性能仍有差距,但这些已合并到 AMD 的 AITER 库和 ATOM 推理引擎的内核改进预示着其朝着与 CUDA vLLM 相当的积极方向发展。 AI
影响 展示了社区驱动的优化在缩小人工智能硬件性能差距方面的潜力,可能影响未来的硬件开发和软件集成。
排序理由 社区驱动的内核优化导致 AMD 硬件在基准测试中相对于竞争对手有所提升。
- AMD
- AnushElangovan
- ATOM
- CUDA
- GPUMODE Readonflow Team
- marksaroufim
- MI355X
- ROCm
- vLLM
- AITER kernel library
- ATOM inference engine
- Kimi K2.5
- Nvidia B200
- Readonflow Team
- ROCm stack
AI 生成摘要 · Google Gemini · 来自 7 个来源。 我们如何撰写摘要 →