Ollama 发布了 v0.32.4 版本,为本地 AI 推理带来了显著的增强,特别是对于拥有 Apple Silicon 硬件的用户。此次更新通过 Apple 的 MLX 引擎支持 Laguna 模型系列,从而在集成 GPU 上实现加速推理。此外,该版本通过量化 draft-model output heads 来优化投机解码,以提高效率和准确性,并修复了 Qwen3 MoE 模型的解码问题。此次更新还包括 llama.cpp 中 Minimax-M3 模型的初步视觉支持,扩展了其多模态能力。 AI
影响 增强了 Apple Silicon 用户本地 AI 推理能力,并扩展了 llama.cpp 中的多模态支持。
排序理由 这是一个用于促进本地 AI 模型推理的工具的软件发布,而不是前沿模型发布或核心研究。
在 Mastodon — fosstodon.org 阅读 →
- Anthropic
- Claude
- Gemini
- Ollama
- Apple Inc.
- Hermes
- Laguna
- Mlx
- Qwen3
- v0.32.3
- v0.32.4
- AMD ROCm
- Apple MLX
- Apple Silicon
- llama.cpp
- Minimax-M3
- NVIDIA
- Nvidia Rubin Gpu
- TensorRT-LLM
AI 生成摘要 · Google Gemini · 来自 6 个来源。 我们如何撰写摘要 →