PulseAugur
实时 14:55:24
English(EN) 2× Radeon R9700 — Qwen 3.6 27B Q8 MTP on llama.cpp

新的 Qwen3.6-27B 量化优化至 16GB 显存,多 GPU 设置展现强劲性能

Qwen3.6-27B 模型发布了新的实验性量化版本,用于本地 LLM 推理,专注于优化 NVIDIA 显存为 16GB 的 GPU 性能。其中一个量化版本 IQ4_KS 调整了代码任务的逻辑,牺牲了通用知识;另一个版本 IQ4_KS_KT 利用 Trellis 算法提高效率。此外,另一位用户详细介绍了他们使用两块总计 64GB 显存的 Radeon R9700 GPU 运行 Qwen 3.6 27B Q8 MTP 模型,并支持大上下文窗口,报告了令人印象深刻的 token 生成和预填充吞吐量。 AI

影响 这些优化和性能基准测试可以帮助硬件有限的用户更有效地运行大型模型,从而可能降低高级 AI 任务的入门门槛。

排序理由 用户驱动的现有开源模型优化和性能报告,而非前沿实验室的新模型发布。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的 Qwen3.6-27B 量化优化至 16GB 显存,多 GPU 设置展现强劲性能

报道来源 [2]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Pablo_the_brave ·

    更新:Qwen-27B-IQ4_KS 和 Qwen-27B-IQ_KS_KT 适用于 ik_llama.cpp,尤其适用于 NVIDIA 16GB 显存

    <!-- SC_OFF --><div class="md"><p>Continuing 16GB VRAM Optimizations: New Qwen3.6-27B GGUF Quants (Experimental Trellis/iq4_kt &amp; MTP)</p> <p>Hi everyone,</p> <p>I'm continuing my optimization efforts for 16GB VRAM and Nvidia GPUs from this post:</p> <p><a href="https://www.re…

  2. r/LocalLLaMA TIER_1 English(EN) · /u/Kal-LZ ·

    2× Radeon R9700 — Qwen 3.6 27B Q8 MTP on llama.cpp

    <!-- SC_OFF --><div class="md"><p>There isn't much information around about multi-GPU setups with the R9700, so I'm writing this up in case it helps anyone in the same situation. Here's my setup, the tests I ran, and the numbers from the server logs.</p> <h2>Setup</h2> <ul> <li>T…