remote direct memory access
PulseAugur coverage of remote direct memory access — every cluster mentioning remote direct memory access across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Mac 用户计划使用 RDMA 和 Thunderbolt 5 构建 DIY AI 集群
一位用户计划使用通过 Thunderbolt 5 连接的多个 Mac Mini 和 Mac Studio 来构建本地 AI 集群。该设置将利用远程直接内存访问 (RDMA) 技术,使这些机器能够汇集内存,有效地作为一个更大的系统来运行大型 AI 模型。用户预计这将是一个长期项目,可能需要几年时间才能完全实现其用于 AI 计算的统一内存系统的目标。
-
Meta AI 发布 MetaRoCE,用于 AI 规模以太网网络
Meta AI 开发了 MetaRoCE,这是一种新的传输协议,旨在提高大型以太网网络上 AI 训练的效率。与依赖无损网络的传统 RoCE 不同,MetaRoCE 将网络视为有损网络,并将排序、路径选择和恢复推送到网络接口卡 (NIC)。这种方法旨在减少网络摩擦,并释放海量 GPU 集群中被闲置的计算能力。Meta 将通过 Open Compute Project 发布该规范、参考实现和合规性测试套件,预计将于 2026 年底出现潜在的硬件支持。
-
新研究通过拓扑感知数据移动优化解耦LLM推理
一篇新研究论文介绍了一个拓扑感知数据移动系统,旨在优化解耦LLM推理。该系统通过发现互连层级和选择最优传输方法来解决在独立GPU池之间传输KV缓存的挑战。它采用了流水线式逐层传输、面向混合专家模型的NVLink域感知放置以及CXL 3.0内存扩展器,以显著降低传输延迟。
-
中国发布国产GPU-RDMA直连,赋能AI算力
在2026世界人工智能大会(WAIC 2026)上,奇异摩尔(Qimor)发布了其全栈自研的超节点互联解决方案。该方案旨在解决中国AI算力“单点强、系统弱”的结构性失衡问题,实现系统级协同。其中一项关键演示是与壁仞科技(Biren Technology)共同开发的IBGDA解决方案,该方案允许国产GPU与国产RDMA网卡直接通信,通过绕过CPU,显著提升AI模型训练和推理的吞吐量并降低延迟。
-
STAGE框架为分布式工作负载合成大语言模型执行图 · 跟踪2个来源
一个名为STAGE的新框架已被开发出来,用于合成大语言模型(LLMs)和专家混合模型(MoEs)的高保真执行图。该框架旨在通过建模各种并行化策略来优化分布式人工智能工作负载,从而能够在无需直接访问大规模基础设施的情况下探索不同的模型架构和系统配置。STAGE通过为超过128,000个GPU生成跟踪记录,证明了其可扩展性,并在计算、内存和通信方面保持了张量级别的准确性。
-
USB4 RDMA 的实现有望提升本地 LLM 性能
已演示了通过 USB4 进行远程直接内存访问 (RDMA) 的实验性实现,这有可能实现通过 USB4 连接的设备之间的高速数据传输。这一在博客文章中详细介绍的进展,可能显著提高需要快速数据交换的应用的性能,例如本地大型语言模型 (LLM) 的运行。
-
Modal 推出超低延迟服务器,适用于高性能应用
Modal 推出了名为 Modal Servers 的新功能,旨在为需要高性能的应用(如交互式代理的 LLM 推理)提供超低延迟服务器托管。这项新产品利用了一个由流式边缘代理、智能无状态代理和计算负载均衡器组成的路由层,该层构建在 Pingora、Envoy 和 Spanner 等技术之上。与提供类似 TCP 的内置可靠性功能的 Modal Web Functions 不同,Modal Servers 针对速度进行了优化,其运行方式更…
-
OpenURMA:华为统一总线协议的开源实现已发布
研究人员开发了OpenURMA,这是华为统一总线(UB)协议的一个开源实现,旨在提高数据中心网络的性能。该实现通过将端点状态与传输状态分离,解决了现代RDMA中的瓶颈问题,从而降低了延迟并提高了吞吐量。OpenURMA在RTL、SystemC仿真和gem5等多个层级提供了干净房间实现,为与RoCEv2等现有技术进行比较提供了基准。
-
T-Head 发布 Panmai 920 智能网卡,完成其 AI 基础设施芯片系列
阿里巴巴子公司平头哥发布了其首款智能网卡“Panmai 920”,旨在解决 AI 计算基础设施的瓶颈问题。这款新网卡采用了先进的 PCIe 5.0 和 112G PAM4 以太网技术,实现了高吞吐量和高数据包处理速率,目标是显著提高大规模 AI 集群中的 GPU 利用率。随着此次发布,平头哥完成了其核心数据中心芯片组合,涵盖计算能力、网络和存储,从而能够提供全面的 AI 基础设施解决方案。
-
NVIDIA与西门子医疗合作开发自适应超声成像AI
NVIDIA与西门子医疗开发了一个名为NV-Raw2Insights-US的新AI模型,该模型直接处理原始超声数据,而非依赖传统的图像重建方法。这种方法使AI能够从每位患者体内声波相互作用的细微差别中学习,从而能够实时生成个性化的声速图以进行自适应图像聚焦。该系统利用NVIDIA的Holoscan平台和Blackwell级GPU进行加速推理,展示了超声成像向端到端AI的转变。