PulseAugur
实时 14:09:17
English(EN) A llama.cpp PR makes Q2_0 3.0–3.6x faster on x86 CPUs, 8B decode goes 2.39 → 8.20 tok/s

llama.cpp PR 将 x86 CPU 上的 Q2_0 量化速度提升 3-3.6 倍

llama.cpp 项目的一个拉取请求(PR)为 Q2_0 量化方法在 x86 CPU 上带来了显著的速度提升。这项利用 AVX-VNNI 指令的优化,可以将各种模型大小的解码速度提高约 3 到 3.6 倍。这些更改目前处于草稿 PR 阶段,并且专门针对 Q2_0 量化,而不是 Q4 或 Q5 等其他常见格式。 AI

影响 提高了消费级硬件上特定量化模型的推理速度,使本地 LLM 部署更高效。

排序理由 这是针对一个流行的 LLM 推理库中特定量化方法的代码优化,而不是新模型发布或重大的研究突破。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

llama.cpp PR 将 x86 CPU 上的 Q2_0 量化速度提升 3-3.6 倍

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/BTA_Labs ·

    A llama.cpp PR makes Q2_0 3.0–3.6x faster on x86 CPUs, 8B decode goes 2.39 → 8.20 tok/s

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vhz989/a_llamacpp_pr_makes_q2_0_3036x_faster_on_x86_cpus/"> <img alt="A llama.cpp PR makes Q2_0 3.0–3.6x faster on x86 CPUs, 8B decode goes 2.39 → 8.20 tok/s" src="https://preview.redd.it/pyim0m155yhh1.jpeg?w…