InferenceX
PulseAugur coverage of InferenceX — every cluster mentioning InferenceX across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
SemiAnalysis 讨论 GPU 经济学、InferenceX 和新硬件
SemiAnalysis 讨论了 GPU 的经济学,其中 InferenceX 团队分享了关于 Engram 内存卸载和 AgentX 利润计算器的见解。对话还涉及 TPU v7,Vera Rubin 与 Blackwell 架构的比较,以及更快的 token 处理的价值。此外,还强调了 TileRT 在推动 NVIDIA GPU 方面的进展,并讨论了专用芯片。
-
GLM5.3稀疏注意力机制影响HBM内存使用
SemiAnalysis详细介绍了GLM5.3的稀疏注意力机制如何影响高带宽内存(HBM)的使用。该分析涵盖了KV缓存卸载和HiSparse等关键技术,这些技术对于优化性能至关重要。它还涉及AgentX TileRT和InferenceX,暗示了AI推理效率的进步。
-
OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出
OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。
-
Vera Rubin NVL72 Agentic Inference System 声称性能提升 67 倍
SemiAnalysis 报道了 Vera Rubin NVL72,一个声称在每美元性能上提供 67 倍提升的 agentic inference 系统。该系统还声称每兆瓦年利润翻倍,并且其模型中购买力增加会导致收益增加。提到的关键组件包括 AgentX、InferenceX 和 Extreme Co-Design,这表明其专注于用户驱动的开发和优化。
-
TPUv7 推出 SparseCore,吞吐量提升 12%,性能超越 Blackwell Ultra
TPUv7 配备了一个称为 SparseCore 的专用硬件单元,用于通过对专家 token 进行分组来管理数据移动。此优化与用于矩阵乘法的 TensorCore 结合使用时,可将吞吐量提高 12%。结合其他增强功能和更低的总体拥有成本,与 Blackwell Ultra 相比,TPU 技术提供了高达 50% 的每美元性能提升,这在 InferenceX 等基准测试中尤为明显。
-
Google TPUv7 Ironwood 在推理任务上优于NVIDIA Blackwell Ultra
SemiAnalysis 报告称,Google 的 TPUv7 Ironwood 硬件在推理任务上,与 NVIDIA 的 Blackwell Ultra 相比,每美元的性能提高了 50%。这一优势是通过新的 TorchTPU 外部推理堆栈实现的,该堆栈在 TPU 上支持原生 PyTorch。Google 的 Pallas 推理内核的开源进一步巩固了这一基础,表明 TPU 外部化具有积极的发展趋势。
-
InferenceX将TPU堆栈外部化,挑战CUDA主导地位
SemiAnalysis报道称,InferenceX在TPU推理外部化方面取得了重大进展,每美元性能可能提高多达50%。该公司正在积极开发其TPU堆栈,在Ironwood和TPUv8i方面取得了显著进步。此举旨在减少对CUDA的依赖,而CUDA是英伟达的关键竞争优势。
-
OpenAI 发布用于推理工作负载的定制 Jalapeño ASIC
OpenAI 与 Broadcom 合作开发了名为 Jalapeño 的自研推理 ASIC。这款定制芯片旨在为 OpenAI 的推理工作负载提供最佳计算平台,专注于每瓦性能和低延迟。Jalapeño ASIC 旨在超越当前行业领导者如 NVIDIA 的 GB200 和 GB300,尤其是在多芯片操作的能效和降低延迟方面。
-
OpenAI 自研“jalapeño”芯片基准测试显示其性能超越 NVIDIA 硬件
OpenAI 发布了其代号为“jalapeño”的定制推理芯片的基准测试结果,该芯片是与博通(Broadcom)合作开发的。据报道,该芯片在每千瓦吞吐量和端到端延迟方面优于 NVIDIA 的 GB300 和 GB200 系统,尤其是在运行 GPT-OSS 120B 等 OpenAI 自有模型时。这种集成的系统方法,结合了硬件、内存、网络和推理软件,旨在减少数据移动和延迟,这对于代理式 AI 应用至关重要。虽然该芯片不用于训练,且 NV…
-
OpenAI 发布定制 Jalapeño 推理芯片的性能数据
OpenAI 发布了其代号为 Jalapeño 的定制推理芯片的性能数据。据报道,在使用 GPT-OSS 120B 模型进行 InferenceX 基准测试时,该芯片的峰值吞吐量每千瓦和令牌延迟均优于现有的商业系统。这标志着 OpenAI 在开发自己的专用 AI 推理硬件方面迈出了重要一步。
-
OpenAI 的 Jalapeño 芯片在推理性能上优于 Nvidia
OpenAI 公布了其定制设计的“Jalapeño”推理芯片的初步性能数据,展示了在速度和能效方面的显著提升。基准测试表明,Jalapeño 在吞吐量和延迟等关键指标上优于 Nvidia 的 Blackwell 和 GB200/GB300 等竞争对手。该芯片在 Broadcom 的合作下,并借助 AI 辅助开发,旨在优化 AI 推理工作负载,并计划部署在 OpenAI 的基础设施中。
-
SemiAnalysis 修订摩根士丹利的 GenAI ROIC 计算
SemiAnalysis 正在批评一份关于生成式人工智能投资回报率 (ROIC) 的摩根士丹利报告,并建议调整资本支出计算。虽然摩根士丹利的报告总体上看好 GenAI ROIC,但 SemiAnalysis 认为该报告对 IT 资本支出和数据中心资本支出的假设不准确。SemiAnalysis 提出了这些支出的替代数字,这将略微降低预测的 ROIC,但仍表明回报强劲。
-
SemiAnalysis 讨论 DeepSeek V4、华为 Ascend NPU 和 LLM 框架竞争
SemiAnalysis 发布了一期节目,讨论了 DeepSeek V4 模型和华为 Ascend NPU 的性能。该节目题为“第 17 集 - DeepSeek V4 和华为 Ascend NPU 性能 (InferenceX)”,由 @noslawextratost 发表见解。此外,讨论还涉及 vLLM 和 SGLang 之间的竞争格局,强调了竞争如何促进该领域的有益进步。
-
DeepSeek V4 凭借新变体实现 100 万上下文,架构变更细节披露 · 已追踪 2 个来源
SemiAnalysis 发布了一期讨论 DeepSeek V4 的节目,重点介绍了其支持一百万 token 上下文窗口的两个变体。由 kimbochen 主持的讨论深入探讨了模型的架构变更,包括注意力机制和一个旨在加速计算的 Mega Mixture-of-Experts (MOE) 系统。该节目还涉及与华为 Ascend NPU 和 InferenceX 的性能比较。
-
SemiAnalysis 详细介绍 DeepSeek V4 的集成和性能
SemiAnalysis 的 InferenceX 团队发布了关于集成 DeepSeek V4 模型(包括对其架构的修改和 MegaKernel 的概念)的详细信息。该团队还分享了 DeepSeek V4 在各种硬件加速器上的初步性能基准,特别提到了华为 Ascend NPU。