一位用户分享了 Qwen3.8-27B 模型在 Strix Halo 硬件上使用 Q4 量化运行的性能指标。基准测试显示,在 96 个请求中,中位数推理速度为每秒 21.23 个 token,最大序列长度 (n-max) 为 4。这些数据在一个多 token 预测 (MTP) 矩阵中呈现。 AI
影响 为特定模型和硬件配置提供了具体的性能数据,有助于用户评估类似的配置。
排序理由 用户分享的特定模型和硬件配置的性能指标。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →