PulseAugur
实时 18:19:47
English(EN) Running Qwen 3.5 35B A3B-Q8_0 gguf on a cheap radeon 7600 at 18 token/s

Qwen 3.5 35B模型在Radeon 7600 GPU上以18 tokens/秒的速度运行

Reddit的r/LocalLLaMA子版块的一位用户分享了他在Radeon 7600 GPU上运行Qwen 3.5 35B模型的经验。他们在Ubuntu系统上使用llama.cpp的特定设置,实现了每秒18个token的速度,突显了该模型在消费级硬件上的性能。 AI

影响 展示了在更易获得的硬件上运行大型语言模型的能力,可能降低本地AI实验的门槛。

排序理由 用户关于在消费级硬件上运行特定模型变体的报告。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen 3.5 35B模型在Radeon 7600 GPU上以18 tokens/秒的速度运行

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Sweaty_Perception655 ·

    在廉价的Radeon 7600上以18 token/s运行Qwen 3.5 35B A3B-Q8_0 gguf

    <!-- SC_OFF --><div class="md"><p>I also have 64 gb ddr4 ryzen 5600 Using llama.cpp Ubuntu distro</p> <p>Settings are as follows</p> <p>--n-gpu-layers 999 \</p> <p>--n-cpu-moe 37 \</p> <p>--no-mmap \</p> <p>-ctk q8_0 \</p> <p>-ctv q8_0 \</p> <p>-fa 1 \</p> <p>-c 9000 \</p> </div>…