对 Ollama 0.30.8 版本的最新分析显示,尽管二进制文件包含 MLX runner 的代码,但在 Apple Silicon 上运行标准 GGUF 模型时,它似乎并未被使用。在 M1 Max 64GB Mac 上进行的调查发现,即使测试了不同的模型架构,日志也一直显示 `llama-server` 是活动的 runner。这表明通过典型的 `ollama pull` 和 `ollama run` 命令运行模型的用户可能无法获得 MLX 所声称的性能提升。 AI
影响 调查 Ollama 等本地 LLM runner 实际使用的后端对于优化特定硬件上的性能至关重要。
排序理由 对特定软件版本功能的技木分析。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →