GB300 NVL72
PulseAugur coverage of GB300 NVL72 — every cluster mentioning GB300 NVL72 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置
Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。
-
Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens
Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。
-
AI服务器需求海量内存:每台配备20TB HBM和17TB RAM
一台拥有72个GPU的GB300 NVL72 AI服务器需要超过20TB的高带宽内存(HBM),主要用于GPU和其他AI芯片。此外,这些服务器还使用了17TB的LPDDR5X RAM,与移动设备中使用的类似。一个吉瓦(gigawatt)的数据中心可以容纳数千台这样的NVL72服务器,凸显了AI巨大的内存需求。
-
Anyscale 将加入 Nscale,增强 Ray 与基础设施的集成
以其分布式计算框架 Ray 而闻名的 Anyscale 公司宣布已签署最终协议加入 Nscale。此次收购旨在深化 Anyscale 的 Ray 软件优化与其数据中心和 GPU 容量等物理基础设施之间的集成。合并后的实体计划在 PyTorch 基金会下,通过成为白金会员的 Nscale 来增强 Ray 在先进硬件上的性能,并保持其开源战略。
-
NVIDIA GB300 NVL72在AI预训练中创世界纪录
NVIDIA使用其GB300 NVL72系统创下了混合专家模型(MoE)预训练的新世界纪录。这一进步突破了大规模AI训练能力能力的极限。
-
Kimi K3 的海量规模尽管经过优化,仍需要密集的网络连接 · 跟踪 8 个来源
SemiAnalysis 报道称,拥有 2.8 万亿参数的 Kimi K3 模型,尽管经过了 Kimi Delta Linear Attention (KDA) 等优化,仍需要显著的网络带宽。该模型的架构需要 WideEP 服务优化,将 896 个专家分布在许多 GPU 上,导致密集的网络使用。这种复杂性意味着,虽然 KDA 减少了 KV 缓存传输,但 Kimi K3 的整体网络需求仍然很大,可能会影响 AI 网络交换机市场。
-
Kimi K3 2.8T 模型需要超越 NVIDIA DGX B200 的先进硬件
Kimi K3 2.8T 模型异常庞大,需要单个 NVIDIA DGX B200 系统以外的专用硬件。为了适应其大小,由于每块 GPU 拥有大量的内存,因此需要涉及 GB300 NVL72、B300 或 MI355X 系统的配置。虽然将多个节点与 WideEP 组合是一个潜在的解决方案,但与 NVL72 等系统相比,B200 有限的节点间带宽构成了一个挑战。
-
NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比
NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。
-
NVIDIA GB300 NVL72 固件错误需要频繁重启
NVIDIA 的 GB300 NVL72 系统中存在一个固件错误,导致机架需要每 66.5 天重启一次。该问题凸显了 NVIDIA 驱动程序和固件质量方面持续存在的问题,尽管该公司通常被认为其软件优于竞争对手。
-
NVIDIA Blackwell 平台在 MLPerf 训练 6.0 基准测试中占据主导地位 · 跟踪 4 个来源
NVIDIA 的 Blackwell 平台在 MLPerf 训练 6.0 行业标准测试的所有七项基准测试中均取得了最佳性能。该平台展示了最快的训练时间和最大的训练规模,使用了多达 8,192 个 GPU。这一成功凸显了该平台通过先进的硬件和网络功能加速 AI 模型开发和降低训练成本的能力。
-
NVIDIA Blackwell 系统领跑新的 Agentic AI 基准测试
NVIDIA 在首个 AgentPerf 和 Agentic AI Benchmark 的 agentic AI 基准测试中创下了新的性能记录。该公司由 Blackwell 架构驱动的 GB300 NVL72 系统在 agentic AI 工作负载中,性能比上一代 Hopper 架构提升了高达 20 倍。这项由 Artificial Analysis 开发的新基准测试,专门衡量 AI 基础设施在持续、多步 agent 轨迹而非单一提示…
-
DeepSeekV4 展现出快速的性能提升,挑战顶级AI模型
拥有1.6万亿参数的DeepSeekV4模型在其发布后的43天内展现出显著的性能提升。早期基准测试表明,该模型在推理和编码等领域具有竞争力,甚至超越了GPT-4和Claude 3 Opus等成熟模型。该模型的开发得到了Huawei先进计算基础设施的支持,包括其GB300 NVL72和MI355X加速器,以及NVIDIA的B200 GPU,这表明了强大的软硬件协同作用。
-
英伟达AI系统成本达780万美元,内存价格飙升
英伟达的下一代AI系统,特别是采用Vera Rubin VR200 NVL72配置的系统,预计每套成本将高达约780万美元。导致成本大幅上涨的一个重要因素是内存组件,目前约占系统总价的25%,相当于每套约200万美元。内存成本的飙升归因于LPDDR5X内存容量增加两倍,以及增加了大量的3D NAND存储,同时Rubin GPU上还集成了HBM4内存。