PulseAugur
实时 15:30:09
English(EN) Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Qwen3.6-35B-A3B模型通过CPU卸载将提示处理速度提升2.36倍

一位Reddit用户分享了在RTX 3090 GPU上优化Qwen3.6-35B-A3B模型的方法。通过将八个混合专家(MoE)层卸载到CPU,他们能够释放VRAM。这使得批处理大小和微批处理大小的增加成为可能,从而在提示处理速度上实现了2.36倍的提升,而生成速度基本保持不变。 AI

影响 展示了一种通过战略性地卸载组件来提高消费级硬件上LLM性能的技术。

排序理由 用户分享的针对特定模型和硬件的优化技术。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.6-35B-A3B模型通过CPU卸载将提示处理速度提升2.36倍

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Longjumping-Music638 ·

    Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

    <!-- SC_OFF --><div class="md"><p>TL;DR: On a Qwen3.6-35B-A3B Q6 setup sized for 64K context on a 24GB RTX 3090, spilling eight MoE expert layers to CPU freed enough VRAM to increase <code>-b</code> from 512 to 1024 and <code>-ub</code> from 128 to 512.</p> <p>Prompt processing i…