最新发布的llama.cpp版本b10427显著加速了消费级GPU上的量化FFN,尤其是在支持SYCL的硬件(如Intel Arc Pro B70)上,提高了Qwen2.5 3B Instruct等模型的推理速度。Meta还推出了Muse Glimmer,一个专为消费级硬件设计的开源、本地优先的多模态Agent,该Agent在Hugging Face上获得了关注。此外,Ollama v0.32.10增强了投机解码功能,以加快本地LLM响应速度,并调整了默认参数以改善模型行为。 AI
影响 通过改进的性能和新的多模态能力,加速了本地AI的部署和实验。
排序理由 开源本地AI推理工具的更新和新的多模态Agent的发布。
- AMD
- Hugging Face
- Intel Arc Pro B70
- llama.cpp
- Meta
- meta-models/Muse-Glimmer-30B
- Muse Glimmer
- NVIDIA
- Ollama
- Qwen2.5 3B Instruct
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →