PulseAugur
实时 23:40:01
English(EN) NInfer day0 support for Qwen3.8 27b: ~200 tok/s generation, with tons of engine improvments

NInfer 为 Qwen3.8-27B 模型增加了 day-zero 支持,并进行了引擎改进

NInfer 推理引擎已为新的 Qwen3.8-27B 模型发布了 day-zero 支持,支持本地部署和实验。此次更新带来了显著的引擎改进,包括支持多达 8 个并发请求(具有共享 KV 缓存)以及实现 ReplaySSM 以降低内存开销。这些优化使得在单个 RTX 5090 GPU 上能够实现约 200 token/秒 的生成速度,即使在使用投机解码的情况下。 AI

影响 支持使用 Qwen3.8-27B 模型进行本地部署和实验,为用户提供改进的性能和并发能力。

排序理由 这是本地推理引擎的软件更新,增加了对特定模型支持,而不是前沿模型发布或重大的行业事件。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

NInfer 为 Qwen3.8-27B 模型增加了 day-zero 支持,并进行了引擎改进

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/FormOne2615 ·

    NInfer day0 support for Qwen3.8 27b: ~200 tok/s generation, with tons of engine improvments

    <!-- SC_OFF --><div class="md"><p>Qwen3.8-27B is finally here, and <a href="https://github.com/Neroued/ninfer">NInfer</a> already has Day-0 support!</p> <p>Weights:<br /> <a href="https://huggingface.co/neroued/Qwen3.8-27B-NInfer">https://huggingface.co/neroued/Qwen3.8-27B-NInfer…