llama.cpp 项目已提交一个新的拉取请求,提议添加 `--n-cpu-ffn` 选项。此功能旨在为密集模型提供 CPU 卸载功能,类似于现有的用于专家混合 (MOE) 模型的 `--n-cpu-moe` 选项。此拉取请求由 John-194 提交,预计将提高在本地硬件上运行密集模型的用户的性能和灵活性,特别是对于 VRAM 有限的用户。 AI
影响 通过改进密集模型的 CPU 卸载,增强了本地 LLM 的部署。
排序理由 开源项目中新功能的拉取请求。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →