一位用户在 Apple M5 Max 芯片上对 Qwen3.8-27B 模型进行了基准测试,比较了“thinking on xhigh”与“thinking off”两种模式下的性能。开启“thinking on xhigh”模式后,处理的 token 数量增加了 5.5 倍,运行时长增加了 6 倍。禁用“thinking”功能显著影响了输出质量,使得模型在每秒 token 处理速度方面落后于 Qwen3.6-35B-A3B 等其他模型。 AI
影响 提供了大型语言模型在消费级硬件上性能权衡的见解。
排序理由 用户在消费级硬件上对特定模型版本的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →