PulseAugur
实时 21:52:34
English(EN) Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak

Qwen3.8-27B 模型针对 RTX 3090 进行了优化,峰值达到 672 tps

一位 Reddit 用户在 RTX 3090 显卡上优化了 Qwen3.8-27B 模型的推理性能,单请求速度达到每秒 82 个 token,并发请求峰值速度高达每秒 672 个 token。优化包括 W4A16 量化、fp8 KV 缓存以及 lm_head 和 embed_tokens 的 int8,将 VRAM 使用量减少到 14.2 GB,同时支持高达 195k token 的上下文长度。该用户已分享了一个包含必要补丁和设置说明的 GitHub 存储库,并指出该模型通过 vLLM 运行,并在 Linux 上进行了测试。 AI

影响 展示了在消费级硬件上运行大型语言模型的先进优化技术。

排序理由 用户在消费级硬件上对现有模型进行驱动式优化。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.8-27B 模型针对 RTX 3090 进行了优化,峰值达到 672 tps

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    RTX 3090 上的 Qwen3.8-27b - 单请求 82 tps,峰值高达 672 tps

    <!-- SC_OFF --><div class="md"><p>Hi,</p> <p>After a long night of optimizations, I believe I have made the fastest inference engine for Qwen3.6-28B on a 3090.</p> <p>Quick metrics:</p> <p>- 250w power capped</p> <p>- Up to 195k context (ships with 150k for safety though)</p> <p>…