Hot Chips 2026
PulseAugur coverage of Hot Chips 2026 — every cluster mentioning Hot Chips 2026 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
Arm AGI server CPU to challenge AMD/Intel in AI inference latency
Arm's new AGI server CPU, with its dual-chiplet design and integrated compute/I/O, is positioned to offer lower latency for AI workloads compared to competing offerings from AMD and Intel. This design choice directly addresses memory bandwidth and latency concerns, suggesting Arm is making a strong play for AI inference markets where these factors are critical.
Emergence of specialized memory tiers (HBM vs. HBF) for AI workloads
The Hot Chips 2026 conference highlights a divergence in memory solutions for AI. While HBM remains the standard for high-throughput inference, High Bandwidth Flash (HBF) is emerging as a viable option for storing very large models due to its capacity and cost, albeit with lower speeds. This suggests a future where AI systems may utilize a tiered memory approach.
IBM's dual-ISA core to enable hybrid AI deployments on mainframes
IBM's new dual-ISA core, capable of running both ARM and z/Architecture natively, could unlock significant opportunities for AI on mainframe systems. This allows existing mainframe infrastructure to leverage the extensive ARM AI software ecosystem without a complete hardware overhaul, potentially accelerating AI adoption in enterprise environments that rely on mainframes.
-
OpenAI 讨论 AI 驱动的芯片设计和代理安全
Tom's Hardware 正在聚焦其 AI 芯片设计周,其中包括对 OpenAI 硬件副总裁 Richard Ho 的采访。讨论内容涵盖了与 Broadcom 联合开发的推理 ASIC “Jalapeño”,以及 AI 如何用于其设计,据称比 Nvidia 实现了更高的效率。该出版物还探讨了 AI 在芯片设计中日益增长的作用,来自 Synopsys、Cadence 和 Siemens 等公司的相关工具,以及潜在的知识产权风险。此外…
-
OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出
OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。
-
Tom's Hardware 提供免费 AI 芯片设计周访问权限
Tom's Hardware 将于 9 月 28 日至 10 月 2 日提供免费的 AI 芯片设计周内容访问权限,只需注册免费会员即可。本周内容包括对 OpenAI 硬件负责人 Richard Ho 的采访,他讨论了他们 AI 设计的推理 ASIC Jalapeño。内容还探讨了 AI 在 EDA 工具中的应用以及 AI 辅助芯片设计的未来。
-
三星计划通过zHBM路线图实现计算与内存的集成
三星已概述了一项三阶段战略,旨在将其高带宽内存(HBM)架构直接集成逻辑和计算能力。该公司的zHBM方法旨在将DRAM直接堆叠在处理器之上,从而无需独立的插入器。这一在Hot Chips 2026上详细介绍的演进,首先将HBM基板移至先进的逻辑工艺,使其能够处理以前由处理器管理的函数,并回收宝贵的XPU面积。
-
Oxmiq Labs 提出用于 AI 推理容量的高带宽闪存
Oxmiq Labs 正在提出高带宽闪存 (HBF) 作为 AI 推理的新容量层,旨在以与高带宽内存 (HBM) 相当的成本提供显著更多的存储空间。他们在 Hot Chips 2026 上的演示概述了 HBF 硬件规格,该规格在相同价格下可提供 HBM 8 到 16 倍的容量。虽然 HBM 在带宽密集型任务中表现出色,但 Oxmiq 建议 HBF 可有效地部署在混合专家 (MoE) 模型中,特别是用于存储专家权重和卸载 KV 缓存,从…
-
Intel 在 Hot Chips 2026 上发布定制加速器,挑战 Nvidia 和 AMD
Servethehome 发布了一系列关于 Hot Chips 2026 定制加速器进展的文章。Intel 推出了旨在与 Nvidia DGX 和 AMD 的 395+/495+ 产品竞争的新型加速器,其特点是拥有极大的内存容量。文章还提到了潜在的带宽限制是这款新硬件的关键因素。
-
云服务商面临内存吃紧,可能将68%的资本支出用于DRAM/NAND
由于动态随机存取存储器(DRAM)和NAND闪存价格飙升,云服务商正面临资本支出的大幅增加。这一在Hot Chips 2026上强调的趋势表明,虽然高带宽闪存(HBF)正成为现实,但云服务提供商的当务之急将是内存分层,而非广泛采用HBF。DRAM和NAND支出的增加预计将转化为消费者云服务成本的提高。
-
Nvidia 宣传 DSX MaxLPS 以在固定功率预算内最大化 AI 计算密度
Nvidia 正在推广其 DSX MaxLPS 电源管理技术,旨在优化固定数据中心功率预算内的计算密度。在 Hot Chips 2026 上,该公司强调该系统与其 Vera Rubin NVL72 GPU 配对使用时,可以在 100MW 的设施中部署多达 40,000 个 GPU。这种动态功率分配方法旨在克服静态配置的限制,允许将未使用的功率更有效地重新分配到最需要的地方,从而最大化每瓦性能。
-
富士通发布 Monaka AI CPU,采用堆叠缓存设计
富士通发布了其新的 Monaka 服务器 CPU,专为绿色数据中心的 AI 性能和能效而设计。该芯片采用独特的三个芯片堆叠:一个 2nm 核心芯片,一个用于整个最后一级缓存的 5nm 芯片,以及一个 5nm I/O 芯片。这种将缓存分离到其自身芯片上的设计,与 AMD 的 3D V-Cache 等现有技术不同。Monaka CPU 将提供 350W 和 500W 配置,预计于 2027 年量产。
-
高带宽闪存提供容量但速度有限,影响 AI 工作负载
在 Hot Chips 2026 上发布的一种新内存格式——高带宽闪存(HBF),以可比的成本提供了比传统高带宽内存(HBM)大得多的容量。然而,HBF 较低的带宽使其不适用于许多对速度至关重要的 AI 工作负载。OXMIQ Labs 展示了,虽然 HBF 可以显著减少存储 Kimi-K2 等大型模型所需的 GPU 数量,但在带宽是限制因素的情况下,HBM 在最大化推理吞吐量和提供更低的每 token 成本方面仍然更胜一筹。普遍的看法…
-
d-Matrix 发布具有 100 TB/s 带宽的 3D DRAM AI 加速器
d-Matrix 发布了其 Raptor AI 加速器,该加速器采用了新颖的 3D 堆叠架构。该设计将 TSMC 4nm 计算芯片直接堆叠在定制设计的 DRAM 芯片之上,实现了每张卡前所未有的 100 TB/s 带宽。该公司声称,与传统的基于 HBM 的设计相比,这种方法显著降低了数据传输的能耗,并预计在生成式推理任务中实现更高的吞吐量。
-
Arm 披露用于 AI 工作负载的双芯片设计 AGI 服务器 CPU
Arm 披露了其即将于 2026 年底发布的 AGI 服务器 CPU。该处理器采用双芯片设计,每个芯片包含 70 个 Neoverse V3 核心,并采用台积电的 N3P 技术。一个关键的设计选择是将计算和 I/O 集成在同一芯片上,这与 AMD 和 Intel 等竞争对手不同。这种方法旨在提高内存带宽并降低延迟,Arm 认为这将有利于对延迟敏感的 AI 工作负载。
-
Google 发布 TPUv8 系列,包含专用训练和推理芯片
Google 发布了其第八代张量处理单元(TPU),即 TPUv8 系列,其中包括用于训练(TPU 8t)和推理(TPU 8i)的独立芯片。这种双芯片策略使 Google 能够优化两种任务的硬件,这是超大规模厂商中一种独特的做法,因为他们通常专注于推理硬件,而使用商品化解决方案进行训练。TPU 8i 特别搭配了 Google 自研的 Axion CPU,标志着这一关键组件转向 Arm 架构。
-
SambaNova公布SN50 AI加速器细节,侧重带宽利用率
SambaNova公布了其SN50 RDU的新技术细节,这是一款专为高效率和低延迟推理设计的专用AI加速器。SN50采用数据流架构,拥有大型片上SRAM,并可扩展至256颗芯片,利用独立的400Gb网络进行横向扩展。虽然SN50使用了较旧的HBM2e内存,但SambaNova强调其改进的带宽利用率模型以及相比传统GPU在性能上的提升,尤其是在代理推理任务方面。
-
Microsoft 详细介绍用于 Azure 数据中心的 Maia 200 AI 加速器
Microsoft 详细介绍了其为 Azure 数据中心设计的 Maia 200 AI 加速器。这款基于台积电 3nm 工艺的第二代芯片,TDP 为 750W,并采用软件定义本地访问 (SDLA) 架构实现确定性数据流。Maia 200 包含一个具有 L1 和 L2 缓存的分层内存结构,以及一个具有硬件恢复机制以提高可靠性的定制网络互连。Microsoft 强调了该芯片在负载均衡方面的重点,以及其扩展到大型域的能力,提供 10,000…
-
Cerebras 推出配备 WSE-3 Turbo 加速器的 CS-4 机架级系统
Cerebras 推出了其新的 CS-4 机架级系统,该系统配备了 WSE-3 Turbo 晶圆级引擎。该系统旨在显著提高性能和能效,与前代产品相比,其代币数量翻倍,每瓦代币数量增加十倍。CS-4 旨在与基于 GPU 的系统竞争,Cerebras 声称其在推理任务上的速度可提高 30 倍。该系统还集成了新的 Nexus 平台,用于硬件骨干网以及改进的供电和散热。
-
三星将逻辑单元集成到LPDDR5X内存中,以加快AI推理速度
三星公司开发了LPDDR5X-PIM,一种将逻辑单元直接集成到内存芯片中的新型内存技术。这种内存处理(PIM)方法旨在降低AI推理任务的成本和功耗,这些任务通常受限于传统内存架构的瓶颈。该公司展示了LPDDR5X-PIM与标准LPDDR5X相比,可以实现显著更高的速度和带宽,从而满足了对AI硬件日益增长的需求和成本担忧。
-
Nvidia 详解用于 Agentic AI 工作负载的 88 核 Vera CPU
在 Hot Chips 2026 上,Nvidia 详细介绍了其即将推出的 Vera CPU,重点介绍了其 88 核设计和定制的 Olympus 核心架构。该 CPU 采用新颖的空间多线程实现和高达 1.2 TB/s 的高带宽内存子系统。Nvidia 声称 Vera 针对 Agentic AI 工作负载进行了优化,在 Web 浏览和 Linux 内核编译等任务中展示了优于 AMD EPYC 9655P 的性能优势。
-
OpenAI 的 Jalapeño 芯片在推理性能上优于 Nvidia
OpenAI 公布了其定制设计的“Jalapeño”推理芯片的初步性能数据,展示了在速度和能效方面的显著提升。基准测试表明,Jalapeño 在吞吐量和延迟等关键指标上优于 Nvidia 的 Blackwell 和 GB200/GB300 等竞争对手。该芯片在 Broadcom 的合作下,并借助 AI 辅助开发,旨在优化 AI 推理工作负载,并计划部署在 OpenAI 的基础设施中。
-
Intel 发布 Xeon 7 'Diamond Rapids',配备 256 个 P 核和 1.28 GB 缓存
Intel 透露了其即将推出的 Xeon 7 'Diamond Rapids' 服务器 CPU 的详细信息,该系列 CPU 计划于 2027 年发布。这些处理器将配备多达 256 个 P 核和高达 1.28 GB 的末级缓存。新架构采用了 Intel 先进的 18A-P 制造工艺,并集成了 UCIe-S 互连、AVX 10.2 指令和新颖的“扇出”互连设计。