llama.cpp 的一项新拉取请求引入了一种在 GPU 上缓存常用专家混合(MoE)层的方法,通过将 Qwen3.6-35B-A3B 等模型在显存有限的消费级硬件上的推理速度最高提升 2 倍。然而,这种优化并非普遍适用,由于开销原因,在某些情况下甚至可能降低性能。同时,llama.cpp 还迎来了其他更新,包括增强了对 Intel GPU 的 SYCL 支持,改进了 iGPU 和 WebGPU F16 性能,并为聊天模型引入了工具调用功能,扩展了其在本地 AI 部署中的用途。 AI
影响 llama.cpp 的优化持续提升了在消费级硬件上运行大型语言模型的可用性和性能。
排序理由 该集群讨论了 llama.cpp 软件的更新和优化,该软件是用于在本地运行大型语言模型的工具,而不是新的前沿模型发布或重大的行业范围事件。
- b10217
- cuda-python
- DeepSeek
- GGUF
- Leela Chess Zero
- Linux
- llama.cpp
- macOS
- NVIDIA
- Reckless
- Rust
- Stockfish
- V4-Flash
- b10226
- KataGo
- OpenCL
- Qwen3.6-27B-Fable-Fusion
- v1.17.1
- WebGPU
- AMD
- GPU
- Hugging Face
- Intel
- Qwen 3.5
- Qwen3.6-35B-A3B
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →