NVIDIA A100 GPUs
PulseAugur coverage of NVIDIA A100 GPUs — every cluster mentioning NVIDIA A100 GPUs across labs, papers, and developer communities, ranked by signal.
-
超级计算机因GPU速度而瓶颈化;新压缩方法提供640倍加速
由于GPU速度极快,超出了数据移动和存储能力,超级计算机正面临着重大的瓶颈。一种名为FaCTz的新型压缩技术通过在NVIDIA A100 GPU上实现60GB/s的速度来解决这一问题,提供了显著的640倍性能提升。该方法保留了精确科学模拟所需的关键拓扑数据。
-
新型MCHA架构提升并行-顺序计算性能
研究人员开发了一种名为MCHA的新硬件架构,旨在加速并行-顺序计算任务。该架构通过采用分层通信策略来减轻主内存的负担,从而解决了传统系统中的瓶颈问题。MCHA还包含一个新颖的编程模型,使用事件驱动触发器来隐藏数据传输延迟。基准测试表明,与NVIDIA A100 GPU相比,MCHA在多智能体强化学习工作负载方面实现了153倍至2400倍以上的显著加速,同时大幅减少了主内存访问。
-
新的MCHA架构在MARL工作负载上实现了高达2456倍的加速
研究人员开发了一种名为MCHA的新硬件架构,旨在加速并行-顺序计算任务。该架构通过采用分层通信策略来减少主内存负载,从而解决了传统系统中的瓶颈问题。MCHA还包含一种新颖的编程模型,可以隐藏数据传输延迟。基准测试表明,与NVIDIA A100 GPU相比,MCHA在多智能体强化学习(MARL)工作负载上实现了153倍到2400多倍的显著加速,同时大幅减少了主内存访问。
-
HARNESS-LM 训练紧凑型模型以实现更快的赞助搜索检索
研究人员开发了 HARNESS-LM (HLM),一种新颖的三阶段训练框架,旨在将大型语言模型的能力转移到紧凑、高效的模型中,用于赞助搜索检索。该方法包括训练一个高性能的“教师”模型,将其知识蒸馏到一个更小的“学生”编码器中,然后优化学生模型以获得最佳检索性能。HLM 成功恢复了教师模型超过 98% 的精度,同时显著降低了延迟并提高了吞吐量,通过在 Bing Ads 上的 A/B 测试证明了其实际效果。