PulseAugur
实时 03:59:26
日本語(JA) Qwen3.5-9B(Q4/6.6GB)にM1 Maxで日本語を書かせたら、答えは131字なのに出力は3936トークンだった

Qwen3.5-9B 模型“思考” token 膨胀输出,拖慢本地 LLM 性能

一位用户在配备 64GB RAM 的 Apple M1 Max 上使用 Ollama 进行本地执行,测试了 Qwen3.5-9B 模型。尽管模型的提示建议其日语能力可以超越 GPT-4,但测试侧重于实际性能指标。Qwen3.5-9B 模型被量化为 Q4,并使用了约 6.6GB 的 VRAM,生成了 131 个字符的日语回复,但总共产生了 3936 个 token。绝大多数这些 token 是用户不可见的内部“思考” token,这严重影响了感知速度。用户发现仅依赖 `eval rate` 指标可能会产生误导,因为实际用户体验比 token 生成速率所暗示的要慢得多。 AI

影响 凸显了内部“思考” token 如何膨胀输出并误导本地 LLM 的性能指标,从而影响用户体验和期望。

排序理由 用户基准测试和特定 LLM 的性能分析。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.5-9B 模型“思考” token 膨胀输出,拖慢本地 LLM 性能

报道来源 [1]

  1. dev.to — LLM tag TIER_1 日本語(JA) · bigkijimon ·

    当我在 M1 Max 上让 Qwen3.5-9B (Q4/6.6GB) 用日语写作时,尽管答案只有 131 个字符,但输出却达到了 3936 个 token。

    <p>「Qwen3.5-9B は Q4量子化・6GB弱のVRAMで、日本語性能がGPT-4を超える」——ローカルLLM界隈でよく見かける類の触れ込みだ。M1 Max 64GBの実機に手持ちの<code>qwen3.5:latest</code>(6.6GB)があったので、実際にどうなのか確かめてみた。</p> <p>先に結論を書く。<strong>「GPT-4超えか」は測れなかった。</strong>これを検証するには大量の日本語プロンプトに対する人間評価が要るし、そもそも比較対象のGPT-4に同条件でアクセスできない。この記事で測れたのは別のことだ——…