NVIDIA GH200
PulseAugur coverage of NVIDIA GH200 — every cluster mentioning NVIDIA GH200 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
GRACE系统通过新的匹配和计算优化加速生成式广告检索
一篇新研究论文介绍了GRACE,一个旨在加速生成式推荐器以进行实时广告检索的系统。GRACE解决了两个关键挑战:通过新颖的生成目标匹配(GTM)技术确保广告资格,以及优化编码器-解码器Transformer的计算成本和延迟。该系统重新设计了解码器以实现宽束、短序列生成,并包括对注意力核、KV缓存和束搜索的优化,显著降低了延迟,并使生成式检索保持在严格的要求内。
-
TESSERA v2 研究揭示地球观测模型的最佳扩展方法
研究人员对像素级地球观测基础模型进行了大规模扩展研究,在 1,024 个 NVIDIA GH200 超级芯片上进行了 395 次训练运行。研究发现,预训练损失是下游性能的糟糕预测指标,这表明将计算资源集中在更大的编码器和更多数据上,而不是更大的投影仪上,更为有效。该团队训练了一系列模型,包括拥有 2100 万个参数的 TESSERA v2-1B-M,其性能优于更大规模的开源和专有模型,并通过 Matryoshka 表示法实现了高效服务。
-
GLM-5.2 模型速度通过自定义优化提升超过 20 倍
一位 Reddit 用户详细介绍了一种在专用 GH200 系统上显著加速 GLM-5.2 大型语言模型的方法。通过组合不同存储库的组件并修补 vLLM 推理引擎,该用户实现了超过每秒 50 个 token 的推理速度,相比模型初始性能有了显著提升。该过程涉及将 zai-org/GLM-5.2-FP8 存储库的权重与 cyankiwi/GLM-5.2-AWQ-INT4 的 AWQ 量化版本合并。
-
GH200 上的 DiffusionGemma 26B 展现极速,支持 32K 上下文
一次技术深度分析揭示,在 NVIDIA 的 GH200 Grace Hopper 平台和 vLLM 优化下运行的 DiffusionGemma 26B 模型,取得了卓越的性能。该配置在短上下文处理中实现了每秒 1180 个 token 的生成吞吐量,并能以可接受的延迟处理长达 32,000 个 token,显著优于之前在 M2 Max 硬件上的测试结果。尽管该模型在 GH200 的 HBM3 上的内存占用很大,为 KV 缓存留下的空间…