PulseAugur
实时 19:49:26
English(EN) 16x AMD MI50 32GB: GLM-5.2 Q4 at 12.2 tok/s with llama.cpp RPC

GLM-5.2 通过 llama.cpp 在 16x AMD MI50 GPU 上以 12.2 tok/s 运行

一位 Reddit 用户 (r/LocalLLaMA) 分享了他们使用 llama.cpp RPC 运行 Q4 量化 GLM-5.2 模型的经验。在处理一个包含 10.7k token 的文档时,他们实现了 12.2 token/秒 的输出速度和 30.9 token/秒 的输入速度。该设置使用了 16 个 AMD MI50 GPU,每个 GPU 拥有 32GB 显存,总计 512GB,分布在两个节点上,并采用了 10 GbE 互连。 AI

影响 展示了在消费级/专业级硬件上运行大型语言模型可实现的推理速度,为基础设施选择提供信息。

排序理由 用户报告了在特定硬件上使用特定软件框架运行特定模型的性能。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

GLM-5.2 通过 llama.cpp 在 16x AMD MI50 GPU 上以 12.2 tok/s 运行

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Legal-Ad-3901 ·

    16x AMD MI50 32GB: GLM-5.2 Q4 at 12.2 tok/s with llama.cpp RPC

    <!-- SC_OFF --><div class="md"><p>GLM-5.2 UD-Q4_K_XL GGUF @ 12.2 tok/s output // 30.9 tok/s input on a real 10.7k-token document using llama.cpp RPC - At 10.7k context: 10.2 tok/s output with coherent long-form generation</p> <ul> <li>Two parallel requests: 14.5 tok/s aggregate</…