Reddit r/LocalLLaMA 版块的一位用户进行了广泛的基准测试,以确定在 macOS 上运行 Qwen3.8-27B 模型最快、最高效的引擎。经过五天和超过 100 小时的 GPU 测试,该用户发现 MTPLX 和支持 MTP(Metal Tensor Parallelism)的 llama.cpp 在代理编码任务方面提供了最佳性能。基准测试包括简短的合成测试、复杂的、多阶段的代理编码挑战以及预填充速度测试。 AI
影响 确定了在本地运行大型语言模型的最佳配置,可能改善用户体验和可访问性。
排序理由 用户进行的基准测试,比较了不同引擎在特定操作系统上运行特定 LLM 的性能。[lever_c_demoted from research: ic=1 ai=1.0]
- llama.cpp
- llama.cpp baseline
- llama.cpp + DFlash2
- macOS
- mlx-dspark DFlash2
- mlx-dspark DSpark
- MTPLX
- Qwen3.8-27B
- vllm-mlx
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →