PulseAugur
中
实时 00:05:40
实体 NVIDIA GH200

NVIDIA GH200

PulseAugur coverage of NVIDIA GH200 — every cluster mentioning NVIDIA GH200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_268679 ·

    新AI模型LAVOIR学会提问

    研究人员开发了LAVOIR,这是一种新颖的决策编码器,旨在改进AI系统提出澄清性问题的方式。与以往猜测信息缺失的模型不同,LAVOIR能够识别并优先考虑最有价值的问题。该系统将信息价值(VOI)直接整合到其决策过程中,从而以更少的问题实现更高的准确性。在研究中,LAVOIR在已见模式上取得了与理论最大值统计上无法区分的结果,并在真实对话中显著提高了准确性。

  2. TOOL · CL_252155 ·

    AI模型BEAST通过新颖的4D并行实现高保真大气预报

    研究人员开发了BEAST,一种用于大气预报的贝叶斯Swin Transformer模型,能够量化不确定性。该模型利用新颖的4D并行方案,在JUPITER超级计算机上高效训练了一个24亿参数的模型,并取得了高性能。BEAST在40年的数据上进行训练,展示了具有竞争力的预测能力,并能以极高的精度预测极端事件,在生成大型集合预报的速度上优于当前的人工智能和数值模型。

  3. SIGNIFICANT · CL_201694 ·

    Qwen3.8-27B 开源模型在基准测试中可与 Claude Opus 相媲美

    Qwen 发布了其 Qwen3.8-27B 模型,这是一个开源模型,在各种基准测试中,尤其是在编码和代理任务方面,其性能可与 Claude Opus 4.6 Max 等更大、专有的模型相媲美。这个拥有 270 亿参数的模型设计用于在消费级 GPU 上运行,提供 262K 的原生上下文窗口,可扩展至 100 万个 token。它还具有原生多模态能力,能够处理图像、PDF 甚至视频,并具有可定制的推理深度以提高效率。

  4. TOOL · CL_181607 ·

    DSv4-Flash 优化提升 NVIDIA GH200 上的 LLM 推理速度

    一种名为 DSv4-Flash 的新优化技术已被开发出来,可显著提高 NVIDIA GH200 硬件上大型语言模型推理的速度。当与 vLLM 和 SGLang 结合使用时,该优化可以在文本生成方面实现每秒超过 300 个 token,并在 192 GB HBM 内支持高达 100 万个 token 的上下文长度。改进细节包含在文章中,其中提供了具体的配置步骤和性能指标。

  5. RESEARCH · CL_180200 ·

    GRACE系统通过生成式推荐器加速实时广告检索

    一篇新的研究论文介绍GRACE,一个旨在加速生成式推荐器以进行实时广告检索的系统。GRACE通过实现生成式目标匹配(GTM)来改进广告定位,并优化编码器-解码器Transformer以降低延迟和成本,从而解决了资格和计算方面的挑战。该系统在NVIDIA GH200硬件上实现了显著的性能提升,将交叉注意力延迟降低了高达68倍,并将整体解码器延迟降低了11.1倍。

  6. RESEARCH · CL_129261 ·

    TESSERA v2 研究揭示地球观测模型的最佳扩展方法

    研究人员对像素级地球观测基础模型进行了大规模扩展研究,在 1,024 个 NVIDIA GH200 超级芯片上进行了 395 次训练运行。研究发现,预训练损失是下游性能的糟糕预测指标,这表明将计算资源集中在更大的编码器和更多数据上,而不是更大的投影仪上,更为有效。该团队训练了一系列模型,包括拥有 2100 万个参数的 TESSERA v2-1B-M,其性能优于更大规模的开源和专有模型,并通过 Matryoshka 表示法实现了高效服务。

  7. TOOL · CL_110108 ·

    GLM-5.2 模型速度通过自定义优化提升超过 20 倍

    一位 Reddit 用户详细介绍了一种在专用 GH200 系统上显著加速 GLM-5.2 大型语言模型的方法。通过组合不同存储库的组件并修补 vLLM 推理引擎,该用户实现了超过每秒 50 个 token 的推理速度,相比模型初始性能有了显著提升。该过程涉及将 zai-org/GLM-5.2-FP8 存储库的权重与 cyankiwi/GLM-5.2-AWQ-INT4 的 AWQ 量化版本合并。

  8. TOOL · CL_100332 ·

    GH200 上的 DiffusionGemma 26B 展现极速,支持 32K 上下文

    一次技术深度分析揭示,在 NVIDIA 的 GH200 Grace Hopper 平台和 vLLM 优化下运行的 DiffusionGemma 26B 模型,取得了卓越的性能。该配置在短上下文处理中实现了每秒 1180 个 token 的生成吞吐量,并能以可接受的延迟处理长达 32,000 个 token,显著优于之前在 M2 Max 硬件上的测试结果。尽管该模型在 GH200 的 HBM3 上的内存占用很大,为 KV 缓存留下的空间…