PulseAugur
实时 05:48:06
实体 GB300 NVL72

GB300 NVL72

PulseAugur coverage of GB300 NVL72 — every cluster mentioning GB300 NVL72 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 13
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 13 条
  1. TOOL · CL_199134 ·

    Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置

    Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。

  2. TOOL · CL_182202 ·

    Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens

    Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。

  3. TOOL · CL_176741 ·

    AI服务器需求海量内存:每台配备20TB HBM和17TB RAM

    一台拥有72个GPU的GB300 NVL72 AI服务器需要超过20TB的高带宽内存(HBM),主要用于GPU和其他AI芯片。此外,这些服务器还使用了17TB的LPDDR5X RAM,与移动设备中使用的类似。一个吉瓦(gigawatt)的数据中心可以容纳数千台这样的NVL72服务器,凸显了AI巨大的内存需求。

  4. RESEARCH · CL_173206 ·

    Anyscale 将加入 Nscale,增强 Ray 与基础设施的集成

    以其分布式计算框架 Ray 而闻名的 Anyscale 公司宣布已签署最终协议加入 Nscale。此次收购旨在深化 Anyscale 的 Ray 软件优化与其数据中心和 GPU 容量等物理基础设施之间的集成。合并后的实体计划在 PyTorch 基金会下,通过成为白金会员的 Nscale 来增强 Ray 在先进硬件上的性能,并保持其开源战略。

  5. TOOL · CL_155885 ·

    NVIDIA GB300 NVL72在AI预训练中创世界纪录

    NVIDIA使用其GB300 NVL72系统创下了混合专家模型(MoE)预训练的新世界纪录。这一进步突破了大规模AI训练能力能力的极限。

  6. COMMENTARY · CL_150219 ·

    Kimi K3 的海量规模尽管经过优化,仍需要密集的网络连接 · 跟踪 8 个来源

    SemiAnalysis 报道称,拥有 2.8 万亿参数的 Kimi K3 模型,尽管经过了 Kimi Delta Linear Attention (KDA) 等优化,仍需要显著的网络带宽。该模型的架构需要 WideEP 服务优化,将 896 个专家分布在许多 GPU 上,导致密集的网络使用。这种复杂性意味着,虽然 KDA 减少了 KV 缓存传输,但 Kimi K3 的整体网络需求仍然很大,可能会影响 AI 网络交换机市场。

  7. TOOL · CL_147608 ·

    Kimi K3 2.8T 模型需要超越 NVIDIA DGX B200 的先进硬件

    Kimi K3 2.8T 模型异常庞大,需要单个 NVIDIA DGX B200 系统以外的专用硬件。为了适应其大小,由于每块 GPU 拥有大量的内存,因此需要涉及 GB300 NVL72、B300 或 MI355X 系统的配置。虽然将多个节点与 WideEP 组合是一个潜在的解决方案,但与 NVL72 等系统相比,B200 有限的节点间带宽构成了一个挑战。

  8. COMMENTARY · CL_142707 ·

    NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比

    NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。

  9. TOOL · CL_108845 ·

    NVIDIA GB300 NVL72 固件错误需要频繁重启

    NVIDIA 的 GB300 NVL72 系统中存在一个固件错误,导致机架需要每 66.5 天重启一次。该问题凸显了 NVIDIA 驱动程序和固件质量方面持续存在的问题,尽管该公司通常被认为其软件优于竞争对手。

  10. RESEARCH · CL_94829 ·

    NVIDIA Blackwell 平台在 MLPerf 训练 6.0 基准测试中占据主导地位 · 跟踪 4 个来源

    NVIDIA 的 Blackwell 平台在 MLPerf 训练 6.0 行业标准测试的所有七项基准测试中均取得了最佳性能。该平台展示了最快的训练时间和最大的训练规模,使用了多达 8,192 个 GPU。这一成功凸显了该平台通过先进的硬件和网络功能加速 AI 模型开发和降低训练成本的能力。

  11. RESEARCH · CL_88265 ·

    NVIDIA Blackwell 系统领跑新的 Agentic AI 基准测试

    NVIDIA 在首个 AgentPerf 和 Agentic AI Benchmark 的 agentic AI 基准测试中创下了新的性能记录。该公司由 Blackwell 架构驱动的 GB300 NVL72 系统在 agentic AI 工作负载中,性能比上一代 Hopper 架构提升了高达 20 倍。这项由 Artificial Analysis 开发的新基准测试,专门衡量 AI 基础设施在持续、多步 agent 轨迹而非单一提示…

  12. SIGNIFICANT · CL_81072 ·

    DeepSeekV4 展现出快速的性能提升,挑战顶级AI模型

    拥有1.6万亿参数的DeepSeekV4模型在其发布后的43天内展现出显著的性能提升。早期基准测试表明,该模型在推理和编码等领域具有竞争力,甚至超越了GPT-4和Claude 3 Opus等成熟模型。该模型的开发得到了Huawei先进计算基础设施的支持,包括其GB300 NVL72和MI355X加速器,以及NVIDIA的B200 GPU,这表明了强大的软硬件协同作用。

  13. SIGNIFICANT · CL_42832 ·

    英伟达AI系统成本达780万美元,内存价格飙升

    英伟达的下一代AI系统,特别是采用Vera Rubin VR200 NVL72配置的系统,预计每套成本将高达约780万美元。导致成本大幅上涨的一个重要因素是内存组件,目前约占系统总价的25%,相当于每套约200万美元。内存成本的飙升归因于LPDDR5X内存容量增加两倍,以及增加了大量的3D NAND存储,同时Rubin GPU上还集成了HBM4内存。