一位用户分享了使用四块 R9700 AI Pro GPU 配合 vLLM-Radiance 获得高 性能的经验。他们报告称,预填充速度达到了每秒 17.6k token,峰值吞吐量为每秒 106 token。该设置运行在配备 EPYC 7282 CPU 的 Gigabyte MZ32-AR0 主板上,使用了 Hermes 模型和 Qwen 3.8 27b,官方支持双 GPU 配置,但用户成功地使用了四块。 AI
影响 展示了本地 LLM 推理的高吞吐量,可能改善用户体验和可访问性。
排序理由 用户报告的本地 LLM 部署的硬件和软件性能基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →