GB300 NVL72
PulseAugur coverage of GB300 NVL72 — every cluster mentioning GB300 NVL72 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
NVIDIA 详解AI工厂战略以实现投资回报最大化
NVIDIA 正在详细介绍其构建旨在实现投资回报最大化的AI工厂的战略,重点关注生产力、耐用性和可互换性。这些工厂旨在通过提供高吞吐量和低每token成本来最大化盈利能力,通过耐用的硬件和软件优化来延长其使用寿命,并通过支持广泛的AI和非AI工作负载来扩大需求。该公司强调,Vera Rubin NVL72系统等AI硬件和软件的进步显著提高了效率并降低了成本,进而推动了对AI计算需求的增长。
-
英伟达CEO黄仁勋被指低估硬件性能
SemiAnalysis的一份报告声称,英伟达CEO黄仁勋大幅低估了其新硬件的性能。黄仁勋在GTC 2026上表示,Rubin NVL72的每瓦性能将比GB300 NVL72提高3倍,但SemiAnalysis自己的测试表明,每瓦性能的提升幅度为7倍。
-
NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 性能测试中首次亮相并取得领先
NVIDIA 宣布其新的 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中取得了领先性能。该系统在 Qwen3-VL 和 DeepSeek-R1 等要求严苛的模型上,吞吐量比前代 GB300 NVL72 高出 3.7 倍。这一性能归功于跨硬件和软件的全栈协同设计,包括增强的 Tensor Cores、Transformer Engine 和优化的互连。NVIDIA 还强调了该系统高效的扩…
-
GB300 NVL72 在代理推理方面提供比 Hopper 每美元高出 13 倍的性能
SemiAnalysis 报告称,GB300 NVL72 采用创新的铜背板和 NVLink,在代理推理方面比 NVIDIA 的 Hopper 架构实现了每美元 13 倍的性能提升。这种先进的设计实现了 72 个 GPU 的大规模扩展域,远大于 Hopper 的 8 个,从而能够实现 vLLM 的宽专家并行等优化。
-
AI机架密度受限于电力和散热,而非芯片
AI服务器机架的密度日益受到电力输送和散热基础设施的限制,而非芯片数量。随着NVIDIA的GB300 NVL72和Vera Rubin NVL72等AI硬件将每机架的功耗推高至142千瓦,甚至可能高达230千瓦,传统的风冷在超过50千瓦后变得不切实际。直接到芯片的液冷可以处理高达150千瓦的功耗,但最终的上限正由电气工程和故障规划设定,传统的54 VDC电力分配系统在约200千瓦时达到极限。
-
Cursor 的 MoK 重新定义 MoE 执行,优化 GPU 内核以加速 AI 训练
Cursor 开发并开源了 Mixture-of-Kittens (MoK),这是一个旨在优化 Mixture-of-Experts (MoE) 模型执行的新软件层。MoK 通过将 token 调度、GPU 间通信和专家计算集成到单个 GPU 内核中来解决效率低下问题。这种方法旨在降低延迟,特别是在大规模 MoE 训练中,通信瓶颈会阻碍性能,尽管 NVIDIA 的 Blackwell GPU 和 NVLink 等硬件有所进步。这项创新…
-
GPU租金上涨,AI基础设施的复杂性超过了标准化进程
即使是像NVIDIA H100这样的老款GPU,其租金也未如预期般下降,原因在于AI任务所需的复杂系统。与传统计算不同,AI工作负载高度依赖GPU与高速网络、存储和软件的集成才能高效运行。这种复杂的系统设计,常被称为“超级节点”,意味着AI计算的性能和成本不仅取决于GPU本身,还取决于整个基础设施维持高利用率和最大限度减少这些昂贵资产空闲时间的能力。
-
Nvidia Vera Rubin 通过异构系统架构将 Agent 通量提升 30 倍 · 跟踪到 1 个来源
Nvidia 正在为其 Vera Rubin NVL72 系统优化 Agent 工作负载,与前几代相比,每兆瓦的吞吐量提高了高达 30 倍。这一性能提升并非完全归功于更快的 GPU,也源于一种异构计算方法,该方法将 Agent 任务分配给专用硬件。该系统现在集成了 Vera Rubin GPU 用于大型模型计算,Groq 3 LPX 用于低延迟 token 生成,Vera CPU 用于工具编排和数据处理,以及 Spectrum-X 网…
-
NVIDIA推出NVLink Fusion,将定制XPUs集成到AI工厂
NVIDIA推出了NVLink Fusion技术,旨在将定制设计的XPUs(eXponential Processing Units)与NVIDIA现有的AI基础设施集成。该解决方案旨在通过提供成熟、高性能的网络和机架级架构来加速AI工厂的开发和部署。NVLink Fusion利用NVLink技术实现加速器之间的高带宽、低延迟通信,并利用NVLink-C2C与CPU进行高效集成,从而降低了构建专业AI硬件的公司的运营风险和上市时间。
-
NVIDIA Vera Rubin NVL72 将 AI 代理效率提升 30 倍,通过与联发科的交易扩展生态系统 · 跟踪 10 个来源
NVIDIA 推出了其 Vera Rubin NVL72 系统,据报道,与之前的 NVIDIA GB300 NVL72 系统相比,该系统在每兆瓦的 AI 代理工作负载吞吐量方面提高了 30 倍。这种显著的效率提升归功于先进的优化和共同设计的软硬件平台,旨在降低每百万个 token 的成本,并在功耗受限的环境中实现更多的代理式 AI 任务。同时,NVIDIA 正通过战略投资和合作伙伴关系扩展其 AI 生态系统,包括以 35 亿美元投资联…
-
Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置
Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。
-
Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens
Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。
-
AI服务器需求海量内存:每台配备20TB HBM和17TB RAM
一台拥有72个GPU的GB300 NVL72 AI服务器需要超过20TB的高带宽内存(HBM),主要用于GPU和其他AI芯片。此外,这些服务器还使用了17TB的LPDDR5X RAM,与移动设备中使用的类似。一个吉瓦(gigawatt)的数据中心可以容纳数千台这样的NVL72服务器,凸显了AI巨大的内存需求。
-
Anyscale 将加入 Nscale,增强 Ray 与基础设施的集成
以其分布式计算框架 Ray 而闻名的 Anyscale 公司宣布已签署最终协议加入 Nscale。此次收购旨在深化 Anyscale 的 Ray 软件优化与其数据中心和 GPU 容量等物理基础设施之间的集成。合并后的实体计划在 PyTorch 基金会下,通过成为白金会员的 Nscale 来增强 Ray 在先进硬件上的性能,并保持其开源战略。
-
NVIDIA GB300 NVL72在AI预训练中创世界纪录
NVIDIA使用其GB300 NVL72系统创下了混合专家模型(MoE)预训练的新世界纪录。这一进步突破了大规模AI训练能力能力的极限。
-
Kimi K3 的海量规模尽管经过优化,仍需要密集的网络连接 · 跟踪 8 个来源
SemiAnalysis 报道称,拥有 2.8 万亿参数的 Kimi K3 模型,尽管经过了 Kimi Delta Linear Attention (KDA) 等优化,仍需要显著的网络带宽。该模型的架构需要 WideEP 服务优化,将 896 个专家分布在许多 GPU 上,导致密集的网络使用。这种复杂性意味着,虽然 KDA 减少了 KV 缓存传输,但 Kimi K3 的整体网络需求仍然很大,可能会影响 AI 网络交换机市场。
-
Kimi K3 2.8T 模型需要超越 NVIDIA DGX B200 的先进硬件
Kimi K3 2.8T 模型异常庞大,需要单个 NVIDIA DGX B200 系统以外的专用硬件。为了适应其大小,由于每块 GPU 拥有大量的内存,因此需要涉及 GB300 NVL72、B300 或 MI355X 系统的配置。虽然将多个节点与 WideEP 组合是一个潜在的解决方案,但与 NVL72 等系统相比,B200 有限的节点间带宽构成了一个挑战。
-
NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比
NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。
-
NVIDIA GB300 NVL72 固件错误需要频繁重启
NVIDIA 的 GB300 NVL72 系统中存在一个固件错误,导致机架需要每 66.5 天重启一次。该问题凸显了 NVIDIA 驱动程序和固件质量方面持续存在的问题,尽管该公司通常被认为其软件优于竞争对手。
-
NVIDIA Blackwell 平台在 MLPerf 训练 6.0 基准测试中占据主导地位 · 跟踪 4 个来源
NVIDIA 的 Blackwell 平台在 MLPerf 训练 6.0 行业标准测试的所有七项基准测试中均取得了最佳性能。该平台展示了最快的训练时间和最大的训练规模,使用了多达 8,192 个 GPU。这一成功凸显了该平台通过先进的硬件和网络功能加速 AI 模型开发和降低训练成本的能力。