最近在 Apple M2 笔记本电脑上对两个本地大型语言模型 (LLM) 进行的测试显示,较旧的 Q4_K_M 量化格式的表现优于较新的 MXFP4 格式。Q4_K_M 格式实现了每秒 4.7 个 token,在 44 秒内完成了 200 个 token 的生成,而 MXFP4 仅达到每秒 2.6 个 token,完成相同任务耗时 71 秒。作者推测,MXFP4 在 M2 芯片上的性能受到反量化成本以及其依赖的硬件功能 M2 不完全支持的阻碍,而 M4 等较新芯片则不受此影响。 AI
影响 这一发现表明,与较新格式的营销宣传相反,旧的量化格式在某些硬件上可能仍然是性能上的首选。
排序理由 该条目详细介绍了在特定硬件上不同 LLM 量化格式的比较性能测试,并提供了经验结果和分析。[lever_c_demoted from research: ic=1 ai=1.0]
- Advanced Matrix Extensions
- Apple M2
- Apple Neural Engine
- Apple Silicon
- gpt-oss-20B
- Hugging Face
- MXFP4
- Ollama
- OpenAI
- Q4_K_M
- Qwen3 14B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →