BeeLlama.cpp 发布了 0.4.1 版本,对 KV 缓存量化进行了重大增强。更新包括 KVarN,可在性能略有折衷的情况下提高每比特精度,以及 KV 缓存精度尾部 (KVPT),允许最近的 token 无损存储,其余的则进行量化。此外,还添加了 q6_0、q6_1、q2_0、q2_1、q3_0 和 q3_1 等新的量化类型,以在精度和 VRAM 使用之间提供更大的灵活性。 AI
影响 通过先进的 KV 缓存量化技术,提供更高效的本地 LLM 部署。
排序理由 这是 llama.cpp 特定分支的软件更新,并非来自前沿实验室的发布。
- BeeLlama.cpp
- KV cache
- KV cache precision tail
- q2_0
- q2_1
- q3_0
- q3_1
- q6_0
- q6_1
- Q8_0
- Qwen 3.6 27B Q5_K_S 64k
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →