NVIDIA 宣布其新的 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中取得了领先性能。该系统在 Qwen3-VL 和 DeepSeek-R1 等要求严苛的模型上,吞吐量比前代 GB300 NVL72 高出 3.7 倍。这一性能归功于跨硬件和软件的全栈协同设计,包括增强的 Tensor Cores、Transformer Engine 和优化的互连。NVIDIA 还强调了该系统高效的扩展能力,在多机架提交中实现了 99% 的效率,并有望通过生成更多 token 和以更低成本服务更多用户来显著改善 AI 推理的经济性。 AI
影响 为 AI 推理硬件设定了新的性能基准,有望降低 AI 部署的成本并提高效率。
排序理由 新硬件系统首次提交至公认的行业基准测试。 [lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →