BeeLlama.cpp 发布了 v0.4.0 版本,这是对其 llama.cpp 分支的重要更新。此次发布专注于增强 KV 缓存量化功能,引入了 KVarN 以提高每比特的精度,并增加了 KV 缓存精度尾部,将最近的 token 以更高精度格式存储。更新还增加了新的标准 KV 缓存量化类型,如 q6_0 和 q6_1,在平衡精度和 VRAM 使用方面提供了更大的灵活性。虽然 KVarN 和精度尾部等功能仍在针对 SWA 等特定架构进行开发,但此次发布旨在为广泛的模型提供更好的性能和更低的 VRAM 成本。 AI
影响 增强了本地 LLM 部署的 KV 缓存效率和精度,可能提高性能并降低 VRAM 使用量。
排序理由 这是特定工具分支的软件发布,而非前沿模型发布或重要的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →