Kimi K3 大型语言模型已成功部署,并在由 16 个 NVIDIA GB10 Grace Blackwell Superchips 组成的集群上运行。该设置实现了平均每秒超过 20 个 token 的吞吐量,预填充操作的峰值吞吐量为每秒 38 个 token 和每秒 750 个 token。部署是通过 vLLM 实现的,预计将发布复制此设置的说明。 AI
影响 展示了 Kimi K3 模型在先进硬件上的性能能力,可能影响未来的部署策略。
排序理由 该条目详细说明了特定 LLM 在特定硬件集群上的性能,包括基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →