Nvidia 正在为其 Vera Rubin NVL72 系统优化 Agent 工作负载,与前几代相比,每兆瓦的吞吐量提高了高达 30 倍。这一性能提升并非完全归功于更快的 GPU,也源于一种异构计算方法,该方法将 Agent 任务分配给专用硬件。该系统现在集成了 Vera Rubin GPU 用于大型模型计算,Groq 3 LPX 用于低延迟 token 生成,Vera CPU 用于工具编排和数据处理,以及 Spectrum-X 网络来连接这些组件。 AI
影响 这种用于 Agent 工作负载的异构架构有望为 AI 推理设定新标准,优化跨不同任务的延迟和吞吐量。
排序理由 文章详细介绍了 AI 推理系统的一次重大架构转变,从单一 GPU 优化转向涉及专用处理器和网络的异构方法,以应对 Agent 工作负载。[lever_c_demoted from significant: ic=1 ai=1.0]
- BlueField-4
- DeepSeek V4-Pro
- Dion Harris
- GB300 NVL72
- Groq 3 LPX
- Nvidia
- SemiAnalysis AgentX
- Spectrum-X
- Vera CPU
- Vera Rubin NVL72
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →