BeeLlama.cpp
PulseAugur coverage of BeeLlama.cpp — every cluster mentioning BeeLlama.cpp across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Gemma 4 QAT 在 KV 缓存量化基准测试中显示出显著提升
新的基准测试表明,Gemma 4 QAT(量化感知训练)显著提高了大型语言模型中 KV 缓存量化的性能。使用 llama.cpp 的一个分支 BeeLlama.cpp 进行的 KLD 基准测试显示,QAT 模型在与非量化模型保持一致方面表现更好,尤其是在较低的量化水平下。这表明 QAT 是一种更稳健的方法,可以在保持精度的同时减小模型大小,特别是对于 Gemma 4 31B 等模型。
-
用户通过KVarN量化在17GB模型上实现100万上下文窗口
Reddit的r/LocalLLaMA论坛上一位用户报告称,他成功加载了一个拥有100万token上下文窗口的大型语言模型,在24GB显存的显卡上使用了约17GB显存。这是通过一个基于Qwen的350亿参数模型实现的,使用了KVarN 4位量化方法来处理KV缓存。该用户能够从文本的各个部分提取信息,表明上下文窗口是功能性的,并且没有损坏。
-
BeeLlama.cpp v0.4.1 通过 KVarN 和精度尾部增强 KV 缓存量化
BeeLlama.cpp 发布了 0.4.1 版本,对 KV 缓存量化进行了重大增强。更新包括 KVarN,可在性能略有折衷的情况下提高每比特精度,以及 KV 缓存精度尾部 (KVPT),允许最近的 token 无损存储,其余的则进行量化。此外,还添加了 q6_0、q6_1、q2_0、q2_1、q3_0 和 q3_1 等新的量化类型,以在精度和 VRAM 使用之间提供更大的灵活性。
-
BeeLlama.cpp v0.4.0 增加了 KVarN 和 KV 缓存精度尾部
BeeLlama.cpp 发布了 v0.4.0 版本,这是对其 llama.cpp 分支的重要更新。此次发布专注于增强 KV 缓存量化功能,引入了 KVarN 以提高每比特的精度,并增加了 KV 缓存精度尾部,将最近的 token 以更高精度格式存储。更新还增加了新的标准 KV 缓存量化类型,如 q6_0 和 q6_1,在平衡精度和 VRAM 使用方面提供了更大的灵活性。虽然 KVarN 和精度尾部等功能仍在针对 SWA 等特定架构进…
-
开发者在 llama.cpp 分支中实现 KVarN KV 缓存压缩
一位开发者在 llama.cpp 项目的一个分支 BeeLlama.cpp 中实现了华为的 KVarN KV 缓存量化技术。该实现允许用户将 KV 缓存压缩 3-5 倍,旨在减少 VRAM 使用量,同时不显著影响模型性能。初步基准测试表明,KVarN 在仅使用 3.5 位的情况下提供了与 4 位量化相当的质量,但速度提升仍在开发中。
-
LLM KV 缓存量化基准测试:q5/q6 性能优于 q8/q4
一项新的基准测试分析显示,KV 缓存量化级别 q5 和 q6 在本地 LLM 方面表现出乎意料地好,优于常用的 q8 和 q4 量化。这项研究使用 BeeLlama.cpp 的一个分支进行,测试了不同 Qwen 3.6 27B 配置下的 38 种量化对。研究结果表明,优先考虑平衡的 KV 缓存量化比在模型权重大量量化的情况下使用更高精度的缓存更有效,尤其是在 VRAM 有限的情况下。
-
BeeLlama.cpp、Qwen 3.6 和 iOS 应用为本地 LLM 加速
本地 LLM 推理的新进展包括 BeeLlama.cpp,它是 llama.cpp 的一个分支,通过 DFlash 和 TurboQuant 等技术显著提升了性能并增加了多模态能力。另外,Qwen 3.6 35B 模型在消费级 GPU 上仅用 12GB VRAM 就展示了令人印象深刻的速度和上下文处理能力,在 128K 上下文下达到了每秒 80 个 token。此外,一个名为 Priv AI 的开源 iOS 应用已发布,允许用户通过 …