Ollama 发布了 0.32.6 版本,通过 MLX 引擎和推测性解码显著提高了 Qwen 3.5 模型在 Apple Silicon Mac 上的性能。此次更新还通过对 /v1/chat/completions 端点的流式格式进行对齐,增强了与 OpenAI API 的兼容性。此外,KataGo 和 llama.cpp 等其他相关项目也收到了错误修复,KataGo 解决了 TensorRT 问题,llama.cpp 解决了 Vulkan 设备丢失错误。 AI
影响 提升了在 Apple Silicon 设备上运行 Qwen 3.5 的用户的本地 AI 推理性能和兼容性。
排序理由 这是本地 AI 推理工具的软件更新,而非主要实验室的前沿模型发布。
在 Mastodon — fosstodon.org 阅读 →
- AMD
- Apple GPUs
- ComfyUI
- Hugging Face
- INT8 quantization
- MLX
- NVIDIA
- Ollama
- OpenAI
- Qwen 3.5
- Qwen3-VL-32B
- CDNA 5
- FFmpeg 9.0
- MLX engine
- Qwen3-VL-32B-Ultra-Heretic-H3
- Apple Silicon
- KataGo
- llama.cpp
- MTP Head
- PyTorch
- TensorRT
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →