PulseAugur
实时 15:42:38
English(EN) I pushed Qwen3.8-27B to 99 tps single request and 1150 tps with a batch request on a RTX 3090

Qwen3.8-27B 模型通过新优化在 RTX 3090 上推至 138 tps · 跟踪 4 个来源

一位用户显著优化了 Qwen3.8-27B 模型在 RTX 3090 GPU 上的推理性能,实现了大幅的性能提升。通过一系列优化,包括 FP8 KV 缓存、模型头部的 INT8 量化以及 DFlash2 和查找增强等先进的草稿技术,用户将单请求吞吐量推至 138 tps,并发吞吐量推至 900 tps 以上。这些改进还极大地降低了对话中后续轮次的延迟,并将上下文长度支持到 262k tokens,同时保持了模型质量。 AI

影响 展示了在消费级硬件上优化现有开源 LLM 的巨大潜力,提高了可访问性和性能。

排序理由 用户驱动的针对特定硬件的现有开源模型优化,而非来自前沿实验室的新模型发布。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →

Qwen3.8-27B 模型通过新优化在 RTX 3090 上推至 138 tps · 跟踪 4 个来源

报道来源 [5]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    我在RTX 3090上将Qwen3.8-27B的单请求推至381 tps

    <!-- SC_OFF --><div class="md"><p>Four days ago I released a <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vq6fdj/qwen3827b_on_rtx_3090_82_tps_single_request_up_to/">hyper-optimized Qwen3.8-27B inference engine</a> for an RTX 3090 (82 tps single request, 672 peak). Since…

  2. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    我再次挑战了Qwen3.8-27B的极限……Dflash2 - 在RTX 3090上达到134 tps

    <!-- SC_OFF --><div class="md"><p>Edit: Title says 134 tps, it's actually 138 -- keep in mind my 3090 is power limited to 250w. </p> <p>Three days ago I released a hyper-optimized Qwen3.8-27B inference engine for an RTX 3090 (82 tps single request, 672 peak), and <a href="https:/…

  3. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    我在RTX 3090上将Qwen3.8-27B单次请求推至124 tps

    <!-- SC_OFF --><div class="md"><p>Two days ago I released a <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vq6fdj">hyper-optimized Qwen3.8-27B</a> inference engine for an RTX 3090 (82 tps single request, 672 peak) - <a href="https://www.reddit.com/r/LocalLLaMA/comments/1v…

  4. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    我在RTX 3090上将Qwen3.8-27B推至单请求99 tps和批量请求1150 tps

    <!-- SC_OFF --><div class="md"><p>I'm back.</p> <p>Yesterday I released <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vq6fdj/comment/p46v06y/?screen_view_count=2&amp;ext-referrer=DIRECT&amp;sort=new">the first version </a>of hyper-optimized Qwen3.8-27B inference engine f…

  5. r/LocalLLaMA TIER_1 English(EN) · /u/iamMess ·

    RTX 3090 上的 Qwen3.8-27b - 单请求 82 tps,峰值高达 672 tps

    <!-- SC_OFF --><div class="md"><p>Hi,</p> <p>After a long night of optimizations, I believe I have made the fastest inference engine for Qwen3.6-28B on a 3090.</p> <p>Quick metrics:</p> <p>- 250w power capped</p> <p>- Up to 195k context (ships with 150k for safety though)</p> <p>…