InfiniBand
PulseAugur coverage of InfiniBand — every cluster mentioning InfiniBand across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
GPU租金上涨,AI基础设施的复杂性超过了标准化进程
即使是像NVIDIA H100这样的老款GPU,其租金也未如预期般下降,原因在于AI任务所需的复杂系统。与传统计算不同,AI工作负载高度依赖GPU与高速网络、存储和软件的集成才能高效运行。这种复杂的系统设计,常被称为“超级节点”,意味着AI计算的性能和成本不仅取决于GPU本身,还取决于整个基础设施维持高利用率和最大限度减少这些昂贵资产空闲时间的能力。
-
NVIDIA AI 基础设施认证计划启动,提供培训资源
现已推出 NVIDIA 认证助理:AI 基础设施与运营 (NCA-AIIO) 认证的培训计划及相关资源。该计划包括录播课程、考试指南和模拟考试,并提供直播课程。一位学员分享了他们通过考试的经验,指出考试侧重于基础概念,并提供了视频概览和免费模拟测试等额外资源,以帮助他人备考。
-
中国发布万卡AI超级集群Sugon 8000
中国发布了其首个国产AI超级集群系统Sugon 8000(Dengfeng),可容纳10万张卡。该系统在世界人工智能大会(WAIC)上首次亮相,上线首周应用即已满载,日均处理超过15万个作业。Sugon 8000旨在支持从大语言模型的训练和推理到科学计算和AI for Science (AI4S) 应用的广泛任务,并为未来的万亿参数模型做好准备。如此大规模系统的开发和部署在性能效率和可靠性方面带来了重大的工程挑战,尤其是在网络、集成、…
-
英伟达推出Vera Rubin超级计算平台,用于AI和HPC
英伟达推出了其Vera Rubin超级计算平台,专为气候建模和能源勘探等要求苛刻的HPC和AI工作负载而设计。该平台集成了Rubin GPU和Vera CPU,采用NVLink、InfiniBand和液冷技术,以实现高密度和高性能。多家制造商将提供基于该架构的系统,预计将于2026年底上市。
-
NVIDIA Vera Rubin NVL4 系统将于 2026 年第四季度推出,AI 算力达 7 百亿亿次 · 追踪 2 个来源
NVIDIA 发布了其 Vera Rubin NVL4 系统,专为气候建模和流体动力学等要求严苛的 HPC 和 AI 工作负载而设计。该平台集成了 Rubin GPU 和 Vera CPU,采用 NVLink、InfiniBand 和液冷技术,实现统一设计。它提供超过 7 百亿亿次的 AI 算力和约 5 千万亿次 FP64 科学计算能力,每机架密度高达 144 个 GPU。包括 Dell、HPE 和 Supermicro 在内的主要制…
-
源自英特尔的网络技术被视为美国能源部InfiniBand的替代方案
源自英特尔(Intel)的网络技术,最初为高性能计算而开发,目前正被重新评估,作为美国能源部(Department of Energy)超级计算计划的InfiniBand替代方案。这项技术此前采用有限,现在正因其在大规模数据中心环境中提供竞争性性能和成本效益的潜力而被考虑。这种兴趣的复苏凸显了对优化网络解决方案以支持苛刻计算任务的持续寻求。
-
通过Thunderbolt fabric实现了InfiniBand网络
一位开发者创建了一个名为thunderbolt-ibverbs的项目,该项目可在Thunderbolt fabric上实现InfiniBand网络。该设置使用USB4线缆和自定义Linux内核模块连接两个AMD Strix Halo mini-PC。由此产生的网络在每个方向上实现了约48 Gb/s的速率,显著优于Thunderbolt上的标准以太网和soft-RoCE。
-
多节点训练赋能跨 GPU 集群扩展基础模型
训练大型基础模型需要将工作负载分布到多台互联机器上的众多 GPU 上,这一过程称为多节点训练。这种方法对于处理参数量达数十亿甚至数万亿、超出单台服务器内存容量且否则需要数月才能完成训练的模型至关重要。有效得多节点训练依赖于复杂的并行策略、高速网络互连和强大的容错机制,以确保计算的高效性和进展。