PulseAugur
实时 09:10:53
实体 8xB200

8xB200

PulseAugur coverage of 8xB200 — every cluster mentioning 8xB200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_128708 ·

    NVIDIA压缩Nemotron-3大语言模型,吞吐量提升2倍,100万token并发提升8倍

    NVIDIA研究人员开发了Nemotron-Labs-3-Puzzle-75B-A9B,这是其Nemotron-3-Super大语言模型的压缩版本。该新变体显著提高了部署效率,在8xB200节点上实现了高达2倍的服务器吞吐量,并在单个H100 GPU上实现了高达8个并发100万token请求。通过结合迭代式Puzzle压缩、知识蒸馏和量化等技术的阶段性流水线实现了压缩,同时在很大程度上保留了模型在下游任务中的准确性。