PulseAugur
实时 05:33:32
实体 NVIDIA GH200

NVIDIA GH200

PulseAugur coverage of NVIDIA GH200 — every cluster mentioning NVIDIA GH200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_180200 ·

    GRACE系统通过新的匹配和计算优化加速生成式广告检索

    一篇新研究论文介绍了GRACE,一个旨在加速生成式推荐器以进行实时广告检索的系统。GRACE解决了两个关键挑战:通过新颖的生成目标匹配(GTM)技术确保广告资格,以及优化编码器-解码器Transformer的计算成本和延迟。该系统重新设计了解码器以实现宽束、短序列生成,并包括对注意力核、KV缓存和束搜索的优化,显著降低了延迟,并使生成式检索保持在严格的要求内。

  2. RESEARCH · CL_129261 ·

    TESSERA v2 研究揭示地球观测模型的最佳扩展方法

    研究人员对像素级地球观测基础模型进行了大规模扩展研究,在 1,024 个 NVIDIA GH200 超级芯片上进行了 395 次训练运行。研究发现,预训练损失是下游性能的糟糕预测指标,这表明将计算资源集中在更大的编码器和更多数据上,而不是更大的投影仪上,更为有效。该团队训练了一系列模型,包括拥有 2100 万个参数的 TESSERA v2-1B-M,其性能优于更大规模的开源和专有模型,并通过 Matryoshka 表示法实现了高效服务。

  3. TOOL · CL_110108 ·

    GLM-5.2 模型速度通过自定义优化提升超过 20 倍

    一位 Reddit 用户详细介绍了一种在专用 GH200 系统上显著加速 GLM-5.2 大型语言模型的方法。通过组合不同存储库的组件并修补 vLLM 推理引擎,该用户实现了超过每秒 50 个 token 的推理速度,相比模型初始性能有了显著提升。该过程涉及将 zai-org/GLM-5.2-FP8 存储库的权重与 cyankiwi/GLM-5.2-AWQ-INT4 的 AWQ 量化版本合并。

  4. TOOL · CL_100332 ·

    GH200 上的 DiffusionGemma 26B 展现极速,支持 32K 上下文

    一次技术深度分析揭示,在 NVIDIA 的 GH200 Grace Hopper 平台和 vLLM 优化下运行的 DiffusionGemma 26B 模型,取得了卓越的性能。该配置在短上下文处理中实现了每秒 1180 个 token 的生成吞吐量,并能以可接受的延迟处理长达 32,000 个 token,显著优于之前在 M2 Max 硬件上的测试结果。尽管该模型在 GH200 的 HBM3 上的内存占用很大,为 KV 缓存留下的空间…