PulseAugur
实时 02:10:05
English(EN) Dual 3090 setup: 400 pp t/s to 1600 pp t/s on Qwen 3.6 27B... with slightly lower tps.

双 3090 GPU 通过切换分割模式在 Qwen 3.6 27B 上实现 1600+ tps

Reddit 的 r/LocalLLaMA 社区的一位用户分享了他在双 3090 GPU 设置上优化 Qwen 3.6 27B 模型性能的经验。最初,使用 `--split-mode tensor` 导致提示处理在 CPU 上进行,每秒 token 处理量(tokens-per-second)仅为 400 左右。经过大量测试,用户发现切换到 `--split-mode layer` 可显著提高性能,将每秒 token 处理量提升至 1600 以上,尽管这略微降低了模型的整体吞吐量。 AI

影响 展示了配置更改如何显著提高本地 LLM 部署的推理速度。

排序理由 用户级别针对特定模型优化现有硬件和软件。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

双 3090 GPU 通过切换分割模式在 Qwen 3.6 27B 上实现 1600+ tps

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/DjCanalex ·

    双 3090 设置:Qwen 3.6 27B 从 400 pp t/s 提升至 1600 pp t/s……每秒 tps 略有下降。

    <!-- SC_OFF --><div class="md"><p>First of all, my setup:</p> <pre><code>Ryzen 9 5950x DDR4 3200Mhz 64gb (2x32) Dual 3090s, no NVLINK </code></pre> <p>Runtime:</p> <pre><code>llama.cpp Nvidia Drivers 610 Windows 11 25H2 Qwen 3.6 27B Q8 </code></pre> <p>I've been using llama-serve…