RoCEv2
PulseAugur coverage of RoCEv2 — every cluster mentioning RoCEv2 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
明玢FX100存储加速AI推理,助力国产替代
明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…
-
AI推理卡将数据库查询延迟降低高达32%
一项新研究强调了国内AI推理加速卡(特别是明心FX100)如何显著提高实时数据库查询性能。通过优化存储访问路径和缩短模型加载时间,这些卡可以将首个token延迟降低高达32%,模型加载时间缩短高达9倍。这些改进在AMD MI308X和华为Ascend 910B平台上均得到验证,表明AI驱动的实时数据库中的瓶颈正从计算转向存储访问,尤其是在处理大型模型时。
-
ServerMO 指南通过 RoCEv2 优化 AI 集群网络
ServerMO 发布了一份指南,详细介绍了如何使用多链路 RoCEv2 标准优化 AI 集群网络。该指南解决了可能导致 GPU 训练停滞的丢包和哈希冲突等问题。它建议绕过操作系统内核使用 RDMA,实现带死锁监视器的无损 PFC,并使用多链路 PCIe 亲和性将 NIC 直接链接到 GPU。
-
OpenURMA:华为统一总线协议的开源实现已发布
研究人员开发了OpenURMA,这是华为统一总线(UB)协议的一个开源实现,旨在提高数据中心网络的性能。该实现通过将端点状态与传输状态分离,解决了现代RDMA中的瓶颈问题,从而降低了延迟并提高了吞吐量。OpenURMA在RTL、SystemC仿真和gem5等多个层级提供了干净房间实现,为与RoCEv2等现有技术进行比较提供了基准。