多个项目正在增强本地 LLM 推理引擎的性能。Kernel Acceleration (VK) 开发了三个引擎(VKAE、VKUE、VKIE),通过多令牌预测等技术将令牌生成速度提高到每秒 601 个令牌,并在 Fast Gemma 挑战赛中被验证为第一名。Llama.cpp 为 GLM-5.2 引入了推测解码,并为 Vulkan 增加了量化连接支持,而 vLLM 则增加了对 Inkling 模型系列的支持,并改进了其 CUDA 图实现以获得更好的性能。此外,Ollama 的最新版本(v0.32.3)专注于本地 AI 模型的稳定性和更广泛的 GPU 兼容性。 AI
影响 本地 LLM 推理速度和效率的这些进步可能会加速设备上 AI 的采用,并减少对云基础设施的依赖。
排序理由 对开源推理引擎及相关技术的多次更新,重点是提高性能和效率。
- AMD
- CUDA
- GLM-5.2
- Inkling
- llama.cpp
- NVIDIA
- Stockfish
- vLLM
- Fortran
- Gemma
- Hugging Face
- Kernel Acceleration (VK)
- Ollama
- VIDRAFT
- Vulkan
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →