一位用户已成功将其流式传输堆栈适配到运行 Qwen3.8-Next 模型,在其 M5 硬件上实现了比密集型 27b 模型更快的性能。Qwen3.8-Next 模型在运行时采用 3 位量化版本,展示了 150 tps 的预填充和 3.6 tps 的解码。此性能超过了在同一 M5 硬件上 4 位密集型 27b 模型实现的 70 tps 预填充和 3 tps 解码。 AI
影响 展示了开源模型在消费级硬件上性能的提升,可能降低本地部署 LLM 的门槛。
排序理由 用户在消费级硬件上对开源模型的基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →