llama.cpp 项目的新拉取请求引入了 `--n-cpu-ffn` 选项,旨在提高 VRAM 有限用户的密集模型性能。此功能允许将指定数量的 FFN 子层卸载到 CPU,类似于现有的 `--n-cpu-moe` 功能。此更改由 John-194 提交,旨在使低端硬件上的密集模型更易于访问。 AI
影响 在本地运行密集模型时,提高 VRAM 有限用户的性能。
排序理由 这是针对开源项目特定功能添加的拉取请求,而非重大发布或重要行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →