一位用户在 12GB 显存的 GPU 上进行了测试,将 Qwen3.8 27B 稠密模型(Q2 和 Q3 量化)与 Qwen3.6 35B-A3B MoE 模型进行了比较。Qwen3.8 27B Q3 模型在健全性提示上取得了满分,但生成速度为 7.5 tokens/second。Qwen3.6 35B-A3B MoE 模型也取得了满分,并且提供了显著更快的生成速度,为 59 tokens/second,尽管提示处理时间略慢。在简短段落测试中,MoE 模型因其在有限硬件上速度和质量的平衡而受到青睐。 AI
影响 展示了 MoE 与稠密模型以及量化级别在消费级硬件上的性能权衡,指导在显存有限的情况下选择最佳模型。
排序理由 用户进行的基准测试,比较了在特定硬件上不同模型量化和架构的性能。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →