一位 Reddit 用户分享了在 DGX Station GB300 上运行 GLM-5.3-flash 模型的经验,在单流模式下实现了约每秒 206 个 token 的速度。该设置使用了 NVFP4,因为它与 Blackwell 架构和 HBM3e 内存兼容。用户提供了详细的 Docker 命令和配置参数以复现该设置,并指出提供的镜像中存在一个需要预先下载模型权重的错误。 AI
影响 展示了 GLM-5.3-flash 在高端硬件上的性能能力,为寻求类似设置的用户提供了见解。
排序理由 用户运行特定模型在特定硬件上的报告,并非模型创建者的官方发布或基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →