llama.cpp 项目发布了更新,增强了 WebGPU 加速功能,并简化了 FlashAttention 的实现,以实现更高效的本地 LLM 推理。同时,PyTorch 的 MPSInductor 现在支持 Apple Metal 代码生成的无符号整数类型,提高了在 Apple Silicon 上的兼容性和性能。此外,一个名为 maple-preview 的新的开源权重混合专家模型正在 Hugging Face 上获得关注,为本地实验提供了一个有前景的选择。 AI
影响 增强了跨各种硬件和操作系统的本地 LLM 推理性能和兼容性。
排序理由 核心本地 AI 库的更新和一款热门的开源模型。
- AMD
- Apple Metal
- FlashAttention
- Hugging Face
- llama.cpp
- maple-preview
- MoE models
- MPSInductor
- NVIDIA
- PyTorch
- WebGPU
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →