llama.cpp
PulseAugur coverage of llama.cpp — every cluster mentioning llama.cpp across labs, papers, and developer communities, ranked by signal.
- 2026-10-06 product_launch The llama.cpp project released version b11454, adding support for K2 Horizon dense and MoVA models. 来源
- 2026-10-05 product_launch llama.cpp released version 0.6.0, introducing MTP speculative decoding and other improvements. 来源
- 2026-10-04 product_launch llama.cpp released version b11395 with support for Windows ARM64 and Vulkan. 来源
- 2026-10-03 research_milestone A pull request was submitted to llama.cpp to optimize Qwen4Exp, reducing indexer score memory. 来源
- 2026-10-02 product_launch The llama.cpp project has launched a new feature called Decision Models. 来源
- 2026-09-04 product_launch The llama.cpp project released multiple updates (b10819, b10817, b10818, b10816, b10814, b10809) with various performance and stability improvements. 来源
- 2026-08-28 product_launch llama.cpp released version b10680 with a Python SDK for Windows. 来源
- 2026-08-27 research_milestone Support for DFlash2 has been merged into the llama.cpp project, enhancing its capabilities. 来源
- 2026-08-27 product_launch A pull request was submitted to add support for the DSpark Nanbeige4.2-3B model to the llama.cpp project. 来源
- 2026-08-22 product_launch The llama.cpp project released version 0.2.0, adopting semantic versioning. 来源
- 2026-08-21 product_launch The llama.cpp project released version 0.2.0, which includes a web user interface in its latest nightly build. 来源
- 2026-08-21 product_launch llama.cpp released version 0.2.0, featuring a new Web UI in its nightly build. 来源
- 2026-08-21 product_launch The llama.cpp project released version b10520 with updates to its ggml-cpu component. 来源
- 2026-08-18 product_launch The Ling-3.0 (BailingMoE3) model has been officially integrated into the llama.cpp mainline. 来源
- 2026-08-18 product_launch llama.cpp released version b10472 with fixes for AMD APU memory reporting. 来源
22 天有情绪数据
llama.cpp 持续实现显著的性能提升,使先进的大型语言模型在各种硬件上运行得更快、更高效。
最新更新大幅优化了 CUDA top-k 算法,使某些模型的速度提升高达 5 倍。用户报告称,他们现有 GPU 的每秒令牌数有了显著提高,这表明核心推理引擎得到了持续改进。这些改进确保了本地大型语言模型推理保持尖端水平且响应迅速。
llama.cpp 正在迅速集成对最新开源模型支持,包括复杂的混合专家(MoE)和多模态架构。
更新现已支持 K2 Horizon dense 及其 MoVA 变体,以及 GLM-5.3-Flash 等模型。至关重要的是,它支持 Google DeepMind 的 EmbeddingGemma 2 等新的多模态嵌入模型,能够对文本、图像和音频进行本地处理。这种广泛的兼容性使 llama.cpp 处于本地人工智能功能的前沿。
量化方面的创新使得大规模的 100B+ 参数模型能够在消费级硬件上高效运行。
专家卸载等技术允许 100B+ MoE 模型在单个 RTX 4090 上运行,方法是利用系统 RAM 来处理不活跃的参数。新的 4 位量化方法(如 180B POCKET-Darwin 模型所使用的)使得这些大型模型即使在 VRAM 有限的笔记本电脑上也能运行。这种对极致效率的关注使强大的 LLM 更加普及。
llama.cpp 生态系统正在通过新的工具、集成和实际应用不断扩展,巩固其基础作用。
新的 WebGPU 引擎正在针对 llama.cpp 进行数值精度验证,并且 Cortex 等项目在其之上构建了兼容 OpenAI 的 API。用户正在使用 llama.cpp 本地运行的 Qwen 3.8-27B 模型替换付费云服务,这展示了其实用性。甚至旧的 PC 也被重新用于本地人工智能任务,这凸显了其广泛的适用性。
llama.cpp 继续在包括 Windows ARM64、AMD 和 NVIDIA GPU 在内的各种硬件上增强其性能。
最近的更新包括 Windows ARM64 Vulkan 支持和重要的 CUDA 优化,例如改进的 pool2d 性能和 ROCm 的新 MUSA 索引器内核。该项目还解决了 ggml-openvino 的后端问题,并优化了 Hexagon 架构,确保在各种计算环境中都能稳健高效地运行。
近期动态
- — llama.cpp 优化 CUDA top-k 算法,显著提速
- — 本地 LLM Qwen 3.8-27B 取代付费 ChatGPT 和 Claude 订阅
- — 180B AI 模型通过 4 位量化在笔记本电脑上运行
- — llama.cpp 更新修复 ggml-openvino 后端问题
- — 新的 WebGPU LLM 引擎针对 llama.cpp 进行数值精度验证
- — llama.cpp 添加 Windows ARM64 Vulkan 支持
为何这些故事上榜
-
98
This cluster highlights a critical performance optimization for CUDA, directly impacting inference speed. Such low-level enhancements are core to llama.cpp's value proposition, making it a top signal for its continuous improvement.
-
99
This represents a major breakthrough in local LLM accessibility. Running a 180B model on consumer laptops via quantization underscores llama.cpp's role in democratizing powerful AI, making it a highly significant development.
-
97
This cluster demonstrates a compelling real-world application and value proposition for llama.cpp. Users replacing paid cloud services with local models powered by llama.cpp is a strong indicator of its practical utility and cost-effectiveness.
-
96
The integration of multimodal capabilities, especially with a model from Google DeepMind, expands llama.cpp's utility beyond text. This signifies its adaptability to evolving AI paradigms and its importance for on-device multimodal applications.
-
95
This cluster clarifies llama.cpp's foundational role within the broader local LLM ecosystem. Understanding its relationship with popular wrappers like Ollama is crucial for users and developers navigating the landscape.
-
94
Validation against llama.cpp by a new WebGPU engine underscores llama.cpp's status as a benchmark for accuracy and reliability. This reinforces its position as a trusted standard in the local inference space.
llama.cpp报道走势
趋势
Coverage of llama.cpp continues its strong upward trajectory, marked by significant performance optimizations like the CUDA top-k speedup (288510) and groundbreaking advancements in making massive models accessible on consumer hardware (282080). The increasing number of real-world applications and ecosystem integrations, such as local models replacing paid cloud services (286161), further fuels this acceleration, showcasing its growing impact.
与同行对比
llama.cpp maintains its leadership as the foundational, high-performance engine for local AI. While Ollama offers a more user-friendly wrapper (283548), llama.cpp consistently delivers the bleeding-edge optimizations and direct control that developers seek. Newer specialized engines or WebGPU alternatives (278580) often benchmark against or build upon llama.cpp, affirming its role as the industry standard for local inference.
话题分布
This cycle, the topic mix for llama.cpp shows a continued strong emphasis on 'infra' (CUDA optimizations, backend fixes) and 'model_release' (new model support, multimodal embeddings). There's an intensified focus on 'quantization' for extreme memory efficiency and a growing discussion around 'product' (local models replacing cloud services) and the competitive landscape of 'on-device' AI applications.
编辑观点
We observe llama.cpp's relentless drive to push the boundaries of local AI. Its continuous, low-level optimizations, exemplified by the CUDA top-k speedup and the ability to run 180B models on laptops, are truly impressive. This commitment not only democratizes access to powerful LLMs but also solidifies its indispensable role as the foundational engine for a rapidly expanding ecosystem of on-device applications and developer tools.
常见问题
- llama.cpp 如何让大型语言模型在消费级硬件上可用?
- 通过先进的量化和专家卸载技术,llama.cpp 走在前沿,实现了在消费级设备上运行大型 LLM。最近的突破使得 1800 亿参数模型可以通过 4 位量化在笔记本电脑上运行,并且通过智能地将不活跃参数卸载到系统 RAM,可以在单个 RTX 4090 GPU 上运行 100B+ 混合专家模型。这些创新大大降低了内存和 VRAM 的需求,使得强大的 AI 在没有昂贵企业硬件的情况下即可使用。
- llama.cpp 现在支持哪些新模型和多模态功能?
- llama.cpp 不断扩展其模型兼容性,现在支持 K2 Horizon dense 和 GLM-5.3-Flash 等架构。一个重要的补充是集成了 Google DeepMind 的 EmbeddingGemma 2 等多模态嵌入模型。这使得能够对包括文本、图像、视频和音频在内的各种数据类型进行本地处理和嵌入,为设备上的多模态 AI 应用(如文档和照片搜索引擎)开辟了新的可能性。
- 与 Ollama 或专用引擎等其他本地 LLM 运行时相比,llama.cpp 表现如何?
- llama.cpp 是一个基础的、高度优化的推理引擎,提供精细的控制和最新的功能。Ollama 虽然因其用户友好性而广受欢迎,但通常作为特定(有时是稍旧)版本的 llama.cpp 的包装器,以便利性为代价,牺牲了对最新优化的即时访问。专用引擎(如从 llama.cpp 分叉出来的引擎或全新的 WebGPU 引擎)是为了满足特定硬件或特定模型优化而出现的,但 llama.cpp 的广泛兼容性和持续的底层性能增强使其在本地 AI 生态系统中保持核心地位。
- llama.cpp 最近为各种 GPU 实施了哪些性能改进?
- llama.cpp 已经推出多项关键性能增强。对于 NVIDIA GPU,CUDA top-k 算法得到了显著优化,带来了显著的速度提升。它还包括改进的 pool2d 函数中的 CUDA 内存读取。对于其他平台,更新解决了 ggml-openvino 后端问题,引入了 Windows ARM64 Vulkan 支持,并优化了 Hexagon 架构以实现更快的 AI 模型推理,确保在包括 AMD 和移动芯片组在内的各种硬件上高效运行。
相关
-
llama.cpp 修复 Hexagon IM2COL DMA 溢出错误
llama.cpp 项目发布了 b11516 版本,该版本解决了整数到整数 (IM2COL) patch-embed 直接内存访问 (DMA) 环溢出问题。当系统尝试排队比环所能容纳的更多的 DMA 描述符时,就会发生此溢出,导致在计算中使用过时的数据。此修复方法是在环满时撤销最旧的描述符,这是一种在同一文件中的类似内核中已采用的方法,并确保正确刷新 DMA 队列。此更新对于 Qualcomm Hexagon 架构上某些切片配置(特别…
-
开发者探索本地AI架构和Agent运行时 · 跟踪3个来源
该集群详细介绍了构建和优化本地AI系统的努力。其中一篇文章探讨了Serverless AI编排架构,重点关注延迟降低。另一篇文章讨论了在Linux上运行本地语言模型(特别是llama.cpp)以完成办公任务。第三篇文章概述了使用Rust、WebAssembly和SQLite创建安全、本地优先的AI Agent运行时,强调沙盒和持久内存。
-
Claude Code 帮助识别 llama.cpp 训练代码中的 17 个 bug
一位名叫 Ron 的陆军退伍军人利用 Anthropic 的 Claude Code 识别并记录了 llama.cpp 训练代码中的 17 个 bug。Ron 开发了一种方法,在测试本身运行之前定义测试的预期结果,从而防止 AI 在看到结果后更改其标准。这种方法涉及一个用于构建和测试的单一代理,并将长时间运行的任务作为分离进程进行管理,以避免持续监控。
-
llama.cpp 优化 CUDA top-k 算法以实现显著加速
llama.cpp 项目发布了一个更新 (b11513),显著优化了 top-k 算法的 CUDA 实现。此更新用更高效的 grid-over-rows radix select 替换了 per-row DeviceTopKKernel,适用于行数较多的情况,从而大幅缩短了处理时间。例如,在 qwen4exp 模型上,使用 34,816 个 token 时,top-k 操作速度从超过 5.7 秒提高到大约 941 毫秒。该版本还根据形…
-
llama.cpp 服务器在其最新版本中增强了上下文检查点处理
llama.cpp 项目发布了 b11506 版本,对其服务器功能进行了一些增强。这些更新侧重于改进跨槽保存和恢复操作的上下文检查点的保留和恢复。主要变化包括确保正确计算检查点,删除不匹配的草稿检查点数据以防止崩溃,以及加固槽保存文件的检查点附录以更优雅地处理潜在错误。该版本还改进了对不完整或空检查点附录的处理方式,确保更健壮的槽保存和加载。
-
寻求 R9700 推理引擎以运行大型语言模型
用户正在寻求关于在 R9700 硬件上运行大型语言模型最高效推理引擎的建议。他们特别希望在多个 R9700 GPU 和系统内存上运行 GLM5.3-Flash,并且还对其他可以满足其硬件限制的大型模型(如 Q-FN 和 DSv4-vision)感兴趣。用户注意到模型分支的泛滥,并寻求关于 GPU 绑定模型与那些需要内存溢出以支持专家混合(MoE)架构的模型最佳选项的指导。
-
llama.cpp ggml-cuda PR 提升 Qwen 3.x 提示处理速度
对 llama.cpp 项目的拉取请求,特别是针对 ggml-cuda,引入了一项优化,即每 warp 分配四个 GDN 状态列。此更改旨在提高 Qwen 3.x 模型的速度,尤其是在提示处理方面。基准测试显示速度有显著提升,Qwen 模型的提示处理在不同上下文大小下速度提高了 5% 以上。
-
llama.cpp项目发布预发布更新,包含各种修复和优化
llama.cpp项目已发布多个预发布更新,包括b11514,该更新解决了Musa FWHT修复和对各种操作系统的平台证明问题。其他版本如b11512和b11511分别侧重于模型修复和CUDA优化。值得注意的是,b11509包含对CUDA CCCL版本保护的修复,b11505解决了Vulkan TOP_K对无限和NaN输入的问题。这些更新还包括了来自不同开发者的贡献以及与cpp-httplib等库的集成。
-
从U盘运行大语言模型揭示了跨操作系统兼容性障碍
一位工程师详细介绍了在尝试跨不同操作系统直接从U盘运行大语言模型(LLMs)时遇到的重大挑战。主要问题包括Windows上缺少Microsoft运行时DLL、Windows上子进程模拟问题、Linux严格的文件管理器策略、FAT32文件系统限制以及文件验证过程中的缓存问题。解决方案包括捆绑必要的DLL、使用不同的Windows可执行文件、为Linux提供手动启动说明、将驱动器格式化为exFAT以及实施更强大的验证过程。
-
ConwayResearch 发布具有广泛兼容性的 Underdog-Saluki-27B-1.0 模型
ConwayResearch 发布了 Underdog-Saluki-27B-1.0 模型,这是一个拥有 270 亿参数的语言模型。此次发布提供了详细的使用说明和兼容性信息,以便将该模型与各种推理引擎和应用程序配合使用。这些工具包括 llama.cpp、vLLM、Ollama、LM Studio 和 Jan 等流行工具,以及笔记本电脑和本地应用程序的集成指南。该模型也可通过 Docker 访问,并在 Raspberry Pi 等设备上运行。
-
本地 LLM 运行时显示不一致的工具调用解析器支持
对四个流行的本地 LLM 运行时——Ollama、llama.cpp、vLLM 和 SGLang——的最新分析显示,它们在支持各种模型系列的工具调用方面存在不一致。虽然这些运行时总共提供了 136 个命名的工具调用解析器,但在所有四个运行时中,只有 8 个支持的模型系列拥有专用的解析器。这些解析器的文档通常滞后于代码更新,许多解析器出现在代码中但未出现在官方文档中。
-
微软整合本地 AI 模型并推广混合智能
微软正在通过为 Windows ML 集成 llama.cpp 和 GGUF 模型的实验性支持来增强其 AI 功能。该公司还在推广“混合智能”方法,该方法结合了本地和云端 AI 处理,其中 Copilot 是一个可以与文件和 PC 操作交互的关键组件。此外,微软还发布了新的本地 AI 模型 MAI-Code-1.1-Flash,并提供支持 Microsoft Agent 365 等 AI 代理的部署和控制的服务。
-
llama.cpp 性能提升,用户报告速度加快
llama.cpp 项目的性能有所提升,用户报告在相同的硬件和模型上速度显著加快。一位用户在更新容器后表示速度提升了 2 T/s,在 3060 显卡上使用 Qwen3.8-27B-GSQ-RCO-IQ2_XS-mtp 模型时达到了约 30 T/s。另一位用户报告称,使用 Qwen3.8-27B-UD-Q4_K_XL 模型时,他的 3090 显卡持续超过 50 T/s。
-
Strata AI 编码工具测试中显示出困惑和错误
一位用户测试了 Strata AI 编码工具,遇到了几个问题,包括对任务完成的困惑、工具输出的幻觉以及编码任务中的反复失败。尽管调整了采样参数并使用了高上下文窗口,该工具仍然表现出记忆失误和编码错误。用户记录了这些事件,指出 Strata 有时会生成格式错误的 कोड 或未能正确识别文件路径。
-
llama.cpp 因本地化大语言模型部署而在舞台上受到关注
llama.cpp 项目,一个用于在本地运行大语言模型的流行 C/C++ 实现,在舞台上受到了关注。这一提及表明了它在社区中为实现高效设备端人工智能而普及和被采用的地位。
-
Liquid AI 发布开源多模态决策模型 d1-3B 和 d1-omni-600M
Liquid AI 发布了两款开源多模态决策模型 d1-3B 和 d1-omni-600M,它们旨在进行实时决策而非文本生成。d1-3B 模型处理文本和图像,而 d1-omni-600M 则处理文本以及图像或音频,在单次前向传播中以零输出令牌返回校准后的答案。这些模型针对 NVIDIA 硬件(包括服务器、工作站和边缘设备)的部署进行了优化,并可在 Hugging Face 上获取,支持 llama.cpp。
-
本地 LLM Qwen 3.8-27B 取代付费 ChatGPT 和 Claude 订阅
一位用户发现,通过 Unsloth 优化并在 llama.cpp 上运行的本地 LLM Qwen 3.8-27B,可以有效替代 ChatGPT 和 Claude 等云端 AI 服务的付费订阅。该本地模型需要 13.3GB 的 VRAM,运行速度约为每秒 33.7 个 token,能够处理诸如摘要、情感分析甚至代码生成等任务,包括从单个文件生成一个功能齐全的贪吃蛇游戏。虽然 Claude 等云端模型在编码能力方面表现出色,但其使用限制和…
-
llama.cpp 为 MoE 模型添加 GPU 缓存以提升性能
一个拉取请求已合并到 llama.cpp 项目,为混合专家 (MoE) 模型引入了 GPU 缓存。此增强功能允许不完全适合 VRAM 的专家保留在主机内存中,从而可能为 GPU 资源有限的用户带来显著的速度提升。
-
llama.cpp 更新 b11479 提升 CUDA pool2d 性能
llama.cpp 项目发布了更新 b11479,其中包括改进 pool2d 函数中的 CUDA 内存读取。此次更新还为 pool2d 带来了性能增强和 __restrict__ 关键字,并调整了 POOL2D_WARP_KERNEL_MIN_WINDOW 宏。此外,该版本还修复了编译器错误。
-
决策模型为分类任务提供低延迟、低成本的LLM替代方案
一类新的“决策模型”正在兴起,它们不同于生成散文的传统大型语言模型。这些更小、更专业的模型,以Jev API shape为例,并得到Ollama和llama.cpp等工具的支持,专为分类任务设计,如工单分类、安全门控和请求路由。虽然它们在公开排行榜上的准确性可能低于大型模型,但其显著降低的延迟和成本使其成为特定用例的有力替代方案。