实体
40 and 100 Gigabit Ethernet
40 and 100 Gigabit Ethernet
PulseAugur coverage of 40 and 100 Gigabit Ethernet — every cluster mentioning 40 and 100 Gigabit Ethernet across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Clos 网络架构:AI 推理集群的成本与选型框架
Clos(或称 Fat-Tree)网络架构因其可扩展性和高带宽而成为大规模 AI 推理集群的流行选择。本文分析了 Clos 网络在拥有数千个 GPU 的集群中的成本构成,包括交换机、线缆和端口密度。文章还讨论了在全面的总体拥有成本(TCO)模型中,将运营费用与初始硬件成本一并考虑的重要性,并强调了高效存储解决方案如何间接优化网络需求。
-
新的 SAOD 技术将 744B LLM 从 1.5TB 压缩至 100GB 以下
一种名为 Session-Adaptive Orthogonal Distillation (SAOD) 的新技术被提出,旨在显著压缩大型语言模型。该方法旨在将一个拥有 7440 亿参数、当前占用 1.5TB 空间的模型压缩至 100GB 以下。其潜在影响是,如此规模的模型可能可以在仅配备 8GB VRAM 的硬件上运行。
-
SkewAdam 优化器将 MoE 训练内存减少 97%
一种名为 SkewAdam 的新优化器已被开发出来,可显著减少训练混合专家(MoE)模型所需的内存。该优化器通过采用分层分配策略,以不同精度级别处理骨干参数、专家参数和路由器参数,实现了 97.4% 的优化器状态内存缩减。这种优化使得一个拥有 67.8 亿参数的 MoE 模型能够运行在单个 40GB GPU 上,而不会影响收敛性或稳定性。