Hopper
PulseAugur coverage of Hopper — every cluster mentioning Hopper across labs, papers, and developer communities, ranked by signal.
- 2026-05-12 product_launch Hypercubic launched Hopper, an agentic development environment for mainframes and COBOL. 来源
5 天有情绪数据
-
REA 项目通过 MCP 服务器统一逆向工程工具
REA(Reverse Engineer Anything)项目引入了一个模型上下文协议(MCP)服务器,旨在通过统一多个专用工具来简化逆向工程。该服务器允许 AI 代理协调静态分析、动态跟踪和二进制检查,而无需管理单个工具的状态。REA 将逆向工程视为一个多阶段的调查,维护一个共享的调查图,该图将 Ghidra、Hopper 和 Frida 等工具的静态和动态结果关联起来。
-
腾讯与甲骨文签署70亿美元协议,采购10万颗离岸AI芯片
据报道,腾讯已与甲骨文达成一项为期五年的协议,租用其位于东南亚数据中心的约10万颗AI芯片,交易价值约70亿美元。此协议是在计算资源租用价格上涨的背景下达成的,预计每颗芯片每小时的成本约为1.60美元,远低于Nvidia H100或B200等高端GPU的当前市场价格。这些芯片在中国无法获得,该协议使腾讯能够获得离岸先进AI训练能力。
-
英伟达的证明可能实现人工智能算力结算的加密证明
目前,人工智能代理的算力结算过程基于活跃度、声誉或支付渠道状态等代理,这些代理无法验证工作是否正确执行。英伟达在Hopper级硬件上的机密计算通过硬件融合的设备身份密钥和远程证明服务提供了一个解决方案。该服务可以生成加密签名的报告,证明哪些代码在特定的硅片上运行,从而实现一种新的结算机制,其中付款以在受信任的执行环境中正确执行工作负载的加密证明为门槛。
-
NVIDIA H100 GPU:Ubuntu 26.04 LTS 配置指南发布
GTZHost 发布了一份指南,详细介绍了在 Ubuntu 26.04 LTS 上配置 NVIDIA H100 GPU 的过程。该教程解决了 Hopper 架构 GPU 所需的特定内核模块设置和后台服务,这与标准硬件部署不同。它强调了裸机 GPU 服务器部署在深度学习训练中的优势,突出了最大共享 PCIe 带宽和零虚拟机管理程序抖动。
-
GB300 NVL72 在代理推理方面提供比 Hopper 每美元高出 13 倍的性能
SemiAnalysis 报告称,GB300 NVL72 采用创新的铜背板和 NVLink,在代理推理方面比 NVIDIA 的 Hopper 架构实现了每美元 13 倍的性能提升。这种先进的设计实现了 72 个 GPU 的大规模扩展域,远大于 Hopper 的 8 个,从而能够实现 vLLM 的宽专家并行等优化。
-
AI 硬件供应链:聚焦第三衍生物赋能者
SemiAnalysis 强调了半导体供应链中那些关键但常被忽视的“第三衍生物”公司,它们赋能了先进的 AI 硬件。这包括材料供应商,如在基板必需的 ABF 薄膜市场占据主导地位的 Ajinomoto,以及化学品公司,如在 ABF 基板的粘合促进化学品方面拥有近乎垄断地位的 MEC。分析还指出,设备制造商如 Eternal Precision Mechanics 和 Taesung,其设备对于基板生产中的多层压合和湿法工艺步骤至关重要…
-
Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens
Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…
-
Perplexity 详解 GPU 嵌入栈,实现高效 AI 搜索
Perplexity 详细介绍了其 GPU 嵌入栈,重点关注服务其 pplx-embed 模型的基础设施。该公司工程团队强调,通过重用其 LLM 栈中的内核,他们优化了批量和在线嵌入工作负载。关键组件包括用于请求处理的 Ivy、用于调度的 Tulip 和用于模型推理的 ROSE,所有这些都旨在最大限度地提高在 Hopper 和 Blackwell 等现代 GPU 硬件上的效率。
-
新研究探索机器人形态与控制学习优化
两篇新研究论文探讨了机器人形态和控制学习的进展。第一篇论文介绍了 AdaControl,一种同时优化机器人形态和控制学习的方法,将计算量减少高达 80%,并发现了多样化的高性能设计。第二篇论文提出了图算子世界模型(Graph-Operator World Models, GraphOp-WM),一种新颖的方法,使机器人能够通过将转移分解为与形态无关的基础和与形态相关的算子来泛化控制到未见的形态参数。
-
Nvidia 寻求 5000 亿美元将算力视为一种资产类别
Nvidia 正在探索一项新的金融策略,将算力视为一种资产类别,目标是与 Apollo、BlackRock 和 Goldman Sachs 等主要金融机构达成 5000 亿美元的融资。首席执行官 Jensen Huang 认为,这些由 Nvidia 的 CUDA 软件增强的、能够产生收入的计算资产代表了金融工程的新领域,类似于抵押贷款支持证券的早期。然而,人们对这些资产的长期价值表示担忧,特别是如果对 GPU 的需求下降,或者 AI …
-
Nebius Blackwell GPU 拍卖创纪录高价,人工智能需求飙升 · 跟踪 1 个来源
Nebius Group 正在经历对其拍卖的数据中心计算容量的异常高需求,特别是对使用 NVIDIA Blackwell 芯片的硬件。这种强劲的需求,体现在拍卖价格比之前 Hopper 芯片的纪录高出 15%,表明一种类似于杰文斯悖论的局面,即由于人工智能代理开发中使用的增加,供应增加并未减少需求。即使是较旧的 NVIDIA GPU(如 A100)也看到了持续多年的需求,这表明整个人工智能行业对计算能力存在广泛而持续的需求。
-
NVIDIA H100 对比 A100:工作负载决定 GPU 选择
在 NVIDIA H100 和 A100 GPU 之间进行选择,取决于具体的应用需求。H100 采用 Hopper 架构,并配备支持 FP8 精度的 Transformer Engine,性能相比 A100 在 FP16 下有显著提升,据称可达 3-4 倍。然而,对于预算有限且需要训练较小模型(最多 300 亿参数)的情况,A100 在 2026 年仍然是更具成本效益的选择。
-
英伟达的 NeMo Switchyard 将 AI 代理成本降低 74%,盖过了其新模型发布
英伟达发布了两项新技术:Nemotron 3.5 Lightning,一个开源权重语言模型;以及 NeMo Switchyard,一个用于 AI 代理的开源路由库。虽然 Nemotron 3.5 Lightning 是一个标准的 30B 参数模型,但 NeMo Switchyard 因其显著降低 AI 代理成本的潜力而备受关注。早期基准测试表明,NeMo Switchyard 可通过智能路由请求至更便宜的模型,将大部分调用避开昂贵的尖…
-
xAI 计划将数据中心扩建 7 倍,目标是到 2027 年实现 5000 亿美元收入
由埃隆·马斯克领导的 xAI 计划大幅扩展其数据中心容量,目标是在 2027 年底前实现七倍增长,达到 10 吉瓦。马斯克预计,此次扩建每年可产生 3000 亿至 5000 亿美元的收入。这项雄心勃勃的计划涉及部署大量基于 NVIDIA Blackwell 的 Vera Rubin 系统,可能容纳数百万个 GPU,并实现超越当前超级计算机和 AI 集群的 ExaFLOPS 级别性能。
-
Anyscale Ray 优化 NVIDIA GB300 NVL72 的 NVLink 域放置
Anyscale 为其 Ray 框架引入了 NVLink 域感知放置组,旨在优化 NVIDIA GB300 NVL72 系统的性能。这些新的放置组确保紧密耦合的 actor 被调度在同一个 NVLink 域内,NVLink 域是一个连接 72 个 NVIDIA Blackwell GPU 和 36 个 NVIDIA Grace CPU 的机架级互连。这种拓扑感知调度原语旨在最大化 GPU 通信并保留系统意图,它建立在先前节点级放置策略的基础上。
-
HOPPER框架通过可学习的跳数提取增强图序列模型
研究人员推出了一种新颖的框架HOPPER,旨在增强线性化图序列模型(LGSMs)。与依赖固定图算子的先前LGSMs不同,HOPPER能够实现跳数序列的端到端学习,从而实现针对特定图结构、节点特征和下游任务量身定制的自适应传播机制。这种方法保留了置换等变性,并在ECHO-Synth和LRIM等基准测试中展示了最先进或具有竞争力的性能,尤其是在图表示学习中处理长距离依赖关系方面。
-
PhyAI引擎统一边缘和云端的物理AI推理
研究人员开发了PhyAI,这是一个统一的推理引擎,旨在简化物理AI模型在各种平台上的部署,包括边缘设备和云环境。这个单一运行时旨在保持一致的检查点和动作语义,同时通过特定模型的适配器优化性能。PhyAI在几种视觉-语言-动作和世界-动作模型上展示了比现有实现显著的速度提升,尽管在某些配置下专用运行时可能仍提供更优越的性能。该引擎的架构允许在GPU上高效执行,详细的性能分析揭示了与延迟和不同模型生成主导相关的性能瓶颈。
-
NVIDIA GPU的Warp Divergence行为在不同架构中保持稳定
一篇新论文分析了从Pascal到Blackwell的NVIDIA GPU架构中的Warp Divergence。研究发现,发散路径会随着路径数量线性串行化,这种行为自Pascal一代以来一直保持一致。虽然发散的核心性能成本一直可预测,但NVIDIA在其编译器发出的重新收敛机制和控制流指令方面,在Ampere、Hopper和Blackwell等架构中已显著发展。
-
AMD的MI500X架构细节曝光,采用共享MoE描述符
据报道,AMD已公布其MI500X集成系统架构的细节,该架构具有一个跨所有专家共享的TDM混合专家(MoE)描述符。该架构似乎是MI455X的演进,集成了TDM,也称为RMA。MI500X的设计似乎借鉴了NVIDIA的SM90 Hopper ISA TMA。
-
Nota AI 发布面向 NVIDIA Blackwell 的 4 位量化 Solar Open2 250B 模型
Nota AI 发布了 Upstage 的 Solar Open2 250B 模型的 4 位量化版本,命名为 Solar Open2 250B — Nota NVFP4。新版本采用了 Nota AI 专有的量化技术,专门针对混合专家(MoE)大语言模型设计。运行此模型的一个关键要求是 NVIDIA Blackwell 架构,因为它利用了该系列中引入的 FP4 张量核心。