PulseAugur
中
实时 16:52:48
实体 GB200

GB200

PulseAugur coverage of GB200 — every cluster mentioning GB200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
25
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_277185 ·

    新的多项式近似提高了在NVIDIA Blackwell GPU上训练大语言模型的速度

    研究人员开发了用于大语言模型(LLMs)中超越函数的新多项式近似方法,以提高计算效率。这些近似方法在NVIDIA Blackwell GPU上进行了测试,在孤立的内核操作中显示出从1.19倍到2.19倍的显著加速。当集成到LLM训练任务中时,这些替换方法在整体训练吞吐量方面带来了明显的改进,某些任务的增益高达8.0%。该研究还评估了这些近似方法对模型行为的影响,发现与原生实现相比,最终训练损失的差异很小。

  2. TOOL · CL_268445 ·

    OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出

    OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。

  3. TOOL · CL_252462 ·

    NVIDIA 开源 OSMO 以统一 AI 机器人开发

    NVIDIA 已开源 OSMO,一个为简化物理 AI 开发而设计的原生 Kubernetes 工作流编排器。该工具允许机器人团队在单个 YAML 文件中定义训练、模拟和机器人测试流程,解决了不同计算层之间的碎片化问题。OSMO 支持跨各种 Kubernetes 环境和边缘设备的便携性,简化了机器人 AI 开发的复杂过程。

  4. SIGNIFICANT · CL_248977 ·

    NVIDIA vLLM发布即支持DeepSeekv4.1 Flash;AMD vLLM滞后

    NVIDIA的vLLM软件已与新的DeepSeekv4.1 Flash模型在所有六种硬件SKU上无缝运行,包括H100、H200、B200、B300、GB200和GB300。相比之下,尽管AMD强调速度,但其vLLM实现却遇到问题,并且尚未公开发布DeepSeekv4.1 Flash模型。这种差异凸显了两家硬件制造商在最新AI模型即时软件支持方面的不同。

  5. SIGNIFICANT · CL_222413 ·

    NVIDIA 为 Blackwell 硬件发布量化版 DeepSeek 和 Qwen LLM

    NVIDIA 已发布两种大型语言模型的量化版本,DeepSeek-V4-Pro-0813 和 Qwen3.8-2.4T-A95B,采用了其 NVFP4 量化方法。DeepSeek 模型拥有 1.65 万亿参数,采用混合注意力机制,并通过 SGLang 在 Nvidia 的 Blackwell B200 硬件上运行。Qwen 模型是一个拥有 2.4 万亿参数、950 亿激活参数的 MoE 模型,支持 100 万 token 的上下文长度…

  6. SIGNIFICANT · CL_220904 ·

    OpenAI 发布 Jalapeño 推理芯片,挑战 NVIDIA 的主导地位

    OpenAI 披露了其定制推理芯片(代号 Jalapeño)的细节,据报道,与 NVIDIA 的 Blackwell 和 Rubin 系列系统相比,该芯片在效率和延迟方面有了显著提升。该芯片专为 OpenAI 的自有基础设施设计,声称在实际模型工作负载中,每瓦特性能提升 1.5–1.9 倍,延迟降低 1.7–3.6 倍。值得注意的是,OpenAI 利用其自身的 AI 模型 GPT-Astra 和 Codex 来协助编写和优化芯片的底层…

  7. SIGNIFICANT · CL_218582 ·

    OpenAI 自研“jalapeño”芯片基准测试显示其性能超越 NVIDIA 硬件

    OpenAI 发布了其代号为“jalapeño”的定制推理芯片的基准测试结果,该芯片是与博通(Broadcom)合作开发的。据报道,该芯片在每千瓦吞吐量和端到端延迟方面优于 NVIDIA 的 GB300 和 GB200 系统,尤其是在运行 GPT-OSS 120B 等 OpenAI 自有模型时。这种集成的系统方法,结合了硬件、内存、网络和推理软件,旨在减少数据移动和延迟,这对于代理式 AI 应用至关重要。虽然该芯片不用于训练,且 NV…

  8. RESEARCH · CL_218710 ·

    OpenAI 的 Jalapeño ASIC 基准测试显示性能优于英伟达 GPU

    OpenAI 与 Broadcom 合作开发了自己的 700W 推理 ASIC,代号为 Jalapeño。OpenAI 发布的基准测试表明,Jalapeño 在每千瓦吞吐量和延迟方面优于英伟达的 GB200 和 GB300 GPU,特别是在 GPT-OSS 120B 和 Moonshot AI 的 Kimi K2.5 等开源模型上。该公司计划今年晚些时候在其自己的数据中心部署这些芯片,随着规模的扩大,可能会影响高带宽内存 (HBM) 供应链。

  9. FRONTIER RELEASE · CL_218490 ·

    OpenAI 的 Jalapeño 芯片在推理性能上优于 Nvidia

    OpenAI 公布了其定制设计的“Jalapeño”推理芯片的初步性能数据,展示了在速度和能效方面的显著提升。基准测试表明,Jalapeño 在吞吐量和延迟等关键指标上优于 Nvidia 的 Blackwell 和 GB200/GB300 等竞争对手。该芯片在 Broadcom 的合作下,并借助 AI 辅助开发,旨在优化 AI 推理工作负载,并计划部署在 OpenAI 的基础设施中。

  10. SIGNIFICANT · CL_217408 ·

    MiniMax H3 使用 NVIDIA Sol Engine 将视频生成延迟缩短 27 倍

    MiniMax AI 使用 NVIDIA 的 Sol Engine 和他们的 MiniMax H3 模型,在视频生成延迟方面取得了重大突破。通过将生成过程分为低分辨率草稿和高分辨率精炼两个阶段,他们将 10 秒、768p 视频的延迟从 414 秒减少到仅 14.93 秒(在单个 GB200 GPU 上)。这种显著的加速从根本上改变了 AI 视频生成的经济性,实现了近乎即时的交互式体验,而不是异步批量渲染。该公司还宣布将与 ComfyU…

  11. FRONTIER RELEASE · CL_201322 ·

    NVIDIA发布具有100万上下文的Nemotron-Labs-Teacher模型 · 跟踪4个来源

    NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。

  12. SIGNIFICANT · CL_204308 ·

    OpenAI 的 Jalapeño 芯片声称效率提升;智能体系统演进

    OpenAI 发布了其定制推理芯片 Jalapeño 的基准测试细节,声称与英伟达的 GB200 和 GB300 系统相比,在效率和延迟方面有显著提升。该芯片据称提供更高的每瓦性能和更低的延迟,预计将于年底部署。同时,智能体框架(agent harnesses)和记忆系统正演变为一等组件,新的研究和开源项目专注于结构化智能体优化、持久化智能体和企业级基础设施。这一转变表明智能体系统正朝着更强大、更适应性的方向发展,框架设计与模型选择同等重要。

  13. TOOL · CL_199134 ·

    Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置

    Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。

  14. RESEARCH · CL_197038 ·

    CoreWeave 签署 2029 年 A100 GPU 合同,证明旧款 AI 硬件的价值

    CoreWeave 是一家专注于 AI 基础设施的云服务提供商,已签署一份直至 2029 年的 NVIDIA A100 GPU 合同,证明了旧款 AI 硬件的持续盈利能力。尽管人们担心 GPU 会迅速过时,但 CoreWeave 的首席执行官强调,这些上一代 GPU 的定价仍然坚挺。这种长寿部分归因于遗留数据中心的供电和散热限制,这使得部署像 NVIDIA 的 Blackwell 架构这样更新、更耗电的 GPU 变得困难,从而使旧款硬件保持需求。

  15. RESEARCH · CL_177880 ·

    中国DFSX芯片的内存带宽是NVIDIA GB200的两倍

    中国的DFSX已开发出一款新芯片,据报道其内存带宽是NVIDIA GB200的两倍。这项进展利用了14nm超级节点工艺,绕过了用于垂直计算内存塔的微凸点。DFSX芯片旨在为高性能计算市场提供具有竞争力的替代方案。

  16. COMMENTARY · CL_173326 ·

    NVIDIA:AI集群性能取决于配置,而非仅硬件

    NVIDIA强调,使用其H100、GB200或GB300系统的相同AI集群,在吞吐量上可能表现出显著差异。该公司的分析表明,特定的配置选择对性能的影响比单纯选择硬件组件更大。

  17. TOOL · CL_170193 ·

    Nota AI 发布面向 NVIDIA Blackwell 的 4 位量化 Solar Open2 250B 模型

    Nota AI 发布了 Upstage 的 Solar Open2 250B 模型的 4 位量化版本,命名为 Solar Open2 250B — Nota NVFP4。新版本采用了 Nota AI 专有的量化技术,专门针对混合专家(MoE)大语言模型设计。运行此模型的一个关键要求是 NVIDIA Blackwell 架构,因为它利用了该系列中引入的 FP4 张量核心。

  18. TOOL · CL_151791 ·

    GMI Cloud 在 2026 世界人工智能大会上发布全栈 AI 解决方案

    GMI Cloud 在 2026 世界人工智能大会上展示了其全面的 AI 基础设施解决方案,重点介绍了其 AI Cloud、MaaS 和 Agentbox 平台。作为 NVIDIA 云合作伙伴,GMI Cloud 提供由 GB300 和 GB200 等高性能芯片驱动的 GPU 云服务,并在台北设有著名的“AI Factory”集群。该公司还展示了用于资源管理的 Cluster Engine、用于模型访问的 Inference Engi…

  19. COMMENTARY · CL_149274 ·

    SemiAnalysis称Kimi K3模型的规模和效率将提振AI硬件需求

    SemiAnalysis认为,尽管Kimi K3模型采用了线性注意力和较低的KV缓存需求,但它对NVIDIA和更广泛的AI硬件生态系统是有益的。该模型拥有庞大的2.8万亿参数,需要大规模的基础设施,包括NVL72等专用机架,其WideEP优化虽然增加了网络带宽需求,但却是为这类系统设计的。此外,杰文斯悖论表明,AI效率的提高最终将导致更广泛的应用,从而增加对GPU、HBM、DRAM和网络基础设施的需求。

  20. SIGNIFICANT · CL_134510 ·

    NVIDIA 的 VR NVL72 系统采用无缆设计,配备 Rubin GPU

    SemiAnalysis 对 NVIDIA 即将推出的 VR NVL72 系统进行了详细分解,重点介绍了与 GB200 等先前架构相比的重大设计变更。关键创新包括无缆计算托盘设计,用 Paladin HD2 板对板连接器取代传统连接器,以提高可靠性并缩短组装时间。该系统使用 Strata 模块,每个模块包含两个 Nvidia Rubin GPU 和一个 Vera CPU,并配有可插拔的 LPDDR5X 内存。