NInfer 推理引擎已为新的 Qwen3.8-27B 模型发布了 day-zero 支持,支持本地部署和实验。此次更新带来了显著的引擎改进,包括支持多达 8 个并发请求(具有共享 KV 缓存)以及实现 ReplaySSM 以降低内存开销。这些优化使得在单个 RTX 5090 GPU 上能够实现约 200 token/秒 的生成速度,即使在使用投机解码的情况下。 AI
影响 支持使用 Qwen3.8-27B 模型进行本地部署和实验,为用户提供改进的性能和并发能力。
排序理由 这是本地推理引擎的软件更新,增加了对特定模型支持,而不是前沿模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →