一位用户在配备 64GB RAM 的 Apple M1 Max 上使用 Ollama 进行本地执行,测试了 Qwen3.5-9B 模型。尽管模型的提示建议其日语能力可以超越 GPT-4,但测试侧重于实际性能指标。Qwen3.5-9B 模型被量化为 Q4,并使用了约 6.6GB 的 VRAM,生成了 131 个字符的日语回复,但总共产生了 3936 个 token。绝大多数这些 token 是用户不可见的内部“思考” token,这严重影响了感知速度。用户发现仅依赖 `eval rate` 指标可能会产生误导,因为实际用户体验比 token 生成速率所暗示的要慢得多。 AI
影响 凸显了内部“思考” token 如何膨胀输出并误导本地 LLM 的性能指标,从而影响用户体验和期望。
排序理由 用户基准测试和特定 LLM 的性能分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →