Q2_0
PulseAugur coverage of Q2_0 — every cluster mentioning Q2_0 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
llama.cpp PR 提升 Intel GPU 和 x86 CPU 性能
llama.cpp 项目的一个拉取请求(PR)为量化 KV 缓存解码带来了显著的性能提升。一项更改针对 Intel Battlemage GPU,通过 SYCL 内核切换,在长上下文长度下实现了高达 169% 的解码速度提升。另一项优化侧重于 x86 CPU,为 Q2_0 量化实现了一个 VNNI 路径,解码性能提升了 3-3.6 倍。尽管这些改进在基准测试中显示出有希望的结果,但它们目前仍处于开放的拉取请求状态,需要在各种硬件配置上…
-
BeeLlama.cpp v0.4.1 通过 KVarN 和精度尾部增强 KV 缓存量化
BeeLlama.cpp 发布了 0.4.1 版本,对 KV 缓存量化进行了重大增强。更新包括 KVarN,可在性能略有折衷的情况下提高每比特精度,以及 KV 缓存精度尾部 (KVPT),允许最近的 token 无损存储,其余的则进行量化。此外,还添加了 q6_0、q6_1、q2_0、q2_1、q3_0 和 q3_1 等新的量化类型,以在精度和 VRAM 使用之间提供更大的灵活性。
-
BeeLlama.cpp v0.4.0 增加了 KVarN 和 KV 缓存精度尾部
BeeLlama.cpp 发布了 v0.4.0 版本,这是对其 llama.cpp 分支的重要更新。此次发布专注于增强 KV 缓存量化功能,引入了 KVarN 以提高每比特的精度,并增加了 KV 缓存精度尾部,将最近的 token 以更高精度格式存储。更新还增加了新的标准 KV 缓存量化类型,如 q6_0 和 q6_1,在平衡精度和 VRAM 使用方面提供了更大的灵活性。虽然 KVarN 和精度尾部等功能仍在针对 SWA 等特定架构进…
-
llama.cpp b9994 为 Apple Silicon 添加 Q2_0 支持
llama.cpp 的最新版本 b9994 在 macOS 和 iOS 上引入了对 Q2_0 量化的支持。此次更新专门针对 Apple Silicon 硬件,并提供了标准配置和 KleidiAI 启用配置的选项。
-
llama.cpp 为 CPU 添加 Q2_0 量化以支持 Ternary Bonsai 模型
一项针对 llama.cpp 项目的拉取请求引入了对 CPU 的 Q2_0 量化支持,主要目的是启用 Ternary Bonsai 模型的使用。此更新完成了 CPU 的 Q1_0、Q2_0、Q4_0 和 Q8_0 量化系列,并计划提交对 x86、Metal、CUDA 和 Vulkan 的额外后端支持。此增强的动机是促进各种 Ternary Bonsai 模型(包括 1.7B、4B 和 8B 参数版本)的部署。