一位 Reddit 用户 (r/LocalLLaMA) 分享了他们使用 llama.cpp RPC 运行 Q4 量化 GLM-5.2 模型的经验。在处理一个包含 10.7k token 的文档时,他们实现了 12.2 token/秒 的输出速度和 30.9 token/秒 的输入速度。该设置使用了 16 个 AMD MI50 GPU,每个 GPU 拥有 32GB 显存,总计 512GB,分布在两个节点上,并采用了 10 GbE 互连。 AI
影响 展示了在消费级/专业级硬件上运行大型语言模型可实现的推理速度,为基础设施选择提供信息。
排序理由 用户报告了在特定硬件上使用特定软件框架运行特定模型的性能。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →