llama.cpp
PulseAugur coverage of llama.cpp — every cluster mentioning llama.cpp across labs, papers, and developer communities, ranked by signal.
- 2026-08-22 product_launch The llama.cpp project released version 0.2.0, adopting semantic versioning. 来源
- 2026-08-21 product_launch llama.cpp released version 0.2.0, featuring a new Web UI in its nightly build. 来源
- 2026-08-21 product_launch The llama.cpp project released version 0.2.0, which includes a web user interface in its latest nightly build. 来源
- 2026-08-21 product_launch The llama.cpp project released version b10520 with updates to its ggml-cpu component. 来源
- 2026-08-18 product_launch The Ling-3.0 (BailingMoE3) model has been officially integrated into the llama.cpp mainline. 来源
- 2026-08-18 product_launch llama.cpp released version b10472 with fixes for AMD APU memory reporting. 来源
- 2026-08-17 product_launch The Llama.cpp project released version 0.1.0. 来源
- 2026-08-17 product_launch The Llama.cpp project released version 0.1.0, featuring AI-driven code creation. 来源
- 2026-08-17 product_launch The llama.cpp project released version v0.1.0, adopting semantic versioning. 来源
- 2026-08-17 product_launch The llama.cpp project released a new testing version, tmp-testing-0. 来源
- 2026-08-16 product_launch The llama.cpp software has released version b10448, adding support for the Kimi-K3 text model. 来源
- 2026-08-14 product_launch llama.cpp released version b10438 with fixes for Granite4 Vision image assembly. 来源
- 2026-08-05 product_launch Qwen3-TTS voice cloning capabilities have been integrated into the mainline of llama.cpp. 来源
- 2026-08-03 product_launch llama.cpp released version b10238 with MTP support for the Qwen3-Next model. 来源
- 2026-08-02 product_launch The llama.cpp project released version b10229 with a bugfix for its OpenCL backend. 来源
30 天有情绪数据
llama.cpp 持续倡导普及人工智能,使强大的模型能够以更高的效率直接在个人硬件上运行。这个开源的 C/C++ 项目针对 CPU、Apple Silicon 和各种 GPU 上的高效本地推理进行了优化。它通过优先考虑设备端执行来普及人工智能,这增强了用户隐私,并显著减少了对昂贵云基础设施的依赖,使高级模型更广泛地可用。 llama.cpp 近期的进展显著提升了推理速度,特别是通过推测解码和优化的模型操作。DFlash 等技术(利用草稿模型实现更快解码)的集成,在某些任务上显示出高达 4.50 倍的速度提升。此外,最新的 b10427 版本加速了消费级 GPU 上的量化 FFNs,改进了 Qwen2.5 3B Instruct 等模型的推理,使本地 AI 响应更加迅速。 llama.cpp 正在迅速集成对尖端模型以及高级代理和多模态功能的支持。Meta 的开源 AI 代理模型 Muse Glimmer 30B 已被集成,利用 llama.cpp 进行本地执行和工具使用。该项目还支持大型专家混合 (MoE) 模型,如蚂蚁集团的 Ling 3.0 Flash,从而在消费级硬件上实现复杂的推理。多模态输入和增强的工具调用能力也正在扩展其用途。 GGUF 格式对于 llama.cpp 至关重要,它促进了量化模型的有效存储和加载,以进行本地推理。GGUF 通过各种量化级别标准化了模型存储,大幅减小了模型大小和内存占用。这使得包括 MoE 架构在内的大型模型能够在消费级 PC 甚至手机上运行。对低比特量化的持续研究,如 Qwen3.6-27B 所示,进一步提高了效率,平衡了模型质量和硬件兼容性,以实现更广泛的采用。 llama.cpp 在各种硬件上始终提供强大的性能,通常在 Apple Silicon 上表现出色,并有效管理 VRAM 限制。基准测试经常突出其在 M1 MacBook 上的强劲表现,有时甚至超越 vLLM 等竞争对手。至关重要的是,当 VRAM 不足时,它可以将模型层卸载到系统 RAM,这使得大型模型可以在性能较低的系统上运行,尽管推理速度会变慢。这种适应性是其广泛用户群的关键优势,正如最近的比较所示。
近期动态
- — llama.cpp V 缓存量化需要 flash_attn 进行上下文窗口计算
- — Liquid AI 发布 DSpark 草稿模型,解码速度提升 3.18 倍,llama.cpp 提供支持
- — llama.cpp b10427 提升量化 FFNs 性能,改进本地 AI 推理
- — DFlash 技术与 llama.cpp 集成,通过推测解码重新定义 LLM 吞吐量
- — 蚂蚁集团 Ling 3.0 Flash MoE 模型通过 GGUF 发布,支持本地使用
- — LLM 推理工具 vLLM、llama.cpp、Ollama 在 VRAM 限制下进行基准测试
为何这些故事上榜
-
96
This cluster is highly notable for introducing DSpark draft models, directly mentioning llama.cpp's support for 3.18x faster decoding. It highlights a significant performance leap for local inference.
-
95
The DFlash technique, integrated with llama.cpp, represents a major advancement in speculative decoding. Its reported 4.50x speedup for coding tasks is a critical development for local LLM performance.
-
93
This cluster signifies a key integration: Meta's Muse Glimmer 30B model into llama.cpp and Ollama. It underscores llama.cpp's role in enabling new, open-source agentic models on consumer hardware.
-
91
This cluster provides a broader update on local AI inference, directly mentioning llama.cpp's b10427 release for FFN acceleration. It corroborates the trend of continuous performance improvements.
-
89
The release of Ant Group's Ling 3.0 Flash MoE model for local use is highly relevant. llama.cpp is a primary enabler for running such large, complex architectures on consumer devices.
-
87
This foundational benchmark comparing llama.cpp, vLLM, and Ollama on VRAM limits remains crucial. It clearly articulates llama.cpp's unique advantage in memory management and diverse hardware support.
llama.cpp报道走势
趋势
Coverage of llama.cpp is maintaining a high level of consistent attention, plateauing with significant quality improvements. Key drivers include ongoing performance enhancements like speculative decoding (211527, 195329) and FFN acceleration (200390), as well as its foundational role in enabling new open-source models like Meta Muse Glimmer (194332) and Ling 3.0 Flash (190317) to run locally. Benchmarks against competitors also continue to generate significant interest.
与同行对比
llama.cpp continues to be a central figure in comparisons with peers like Ollama and vLLM. It consistently garners attention for its superior performance on Apple Silicon and its unique ability to manage VRAM constraints by offloading to system RAM. While vLLM might offer higher throughput on high-end NVIDIA GPUs, llama.cpp's versatility and accessibility across diverse consumer hardware, including its integration into tools like Ollama, remain its distinguishing factors, with new players like Liquid AI also emerging in speculative decoding.
话题分布
This cycle, the topic mix for llama.cpp shows a continued emphasis on 'infra' (performance, quantization, hardware optimization) and 'product' (new applications and model integrations). There's a notable shift towards 'speculative decoding', 'agentic' capabilities, and 'multimodal' support, alongside a focus on advanced inference techniques and robust local server solutions.
编辑观点
We see llama.cpp continuing its vital role in democratizing AI, particularly through its robust performance on consumer hardware and its foundational support for local, private applications. The ongoing benchmarks underscore its competitive edge on Apple Silicon and its unique memory management. Its expansion into advanced inference techniques like speculative decoding and support for agentic/multimodal models further solidifies its position as a versatile and indispensable open-source project.
常见问题
- llama.cpp 最新的性能增强有哪些?
- llama.cpp 的最新更新主要集中在显著加速本地推理。这包括集成 DFlash 进行推测解码,可提供显著的速度提升,以及 b10427 版本,该版本提升了消费级 GPU 上的量化 FFNs 性能。这些改进旨在提高吞吐量和效率,使大型语言模型在消费级硬件上运行更快,尤其适用于要求严苛的任务。
- llama.cpp 如何支持新的代理和多模态模型?
- llama.cpp 正在日益支持先进模型,例如 Meta 的开源 AI 代理模型 Muse Glimmer 30B,使其能够在本地执行工具使用和代理任务。它还支持运行大型专家混合 (MoE) 模型,如蚂蚁集团的 Ling 3.0 Flash。该框架的持续开发包括对多模态输入和精细工具调用功能的支持,从而扩展了其在个人设备上处理复杂 AI 应用的实用性。
- 使用 llama.cpp 运行本地 LLM 时常见的有哪些问题,如何解决?
- 用户在使用 llama.cpp 运行本地 LLM 时,有时会遇到文本无限生成或停止标记识别不正确等问题。这通常发生在默认配置缺少长度限制或未应用正确的聊天模板时。诊断 API 响应中的 `finish_reason` 并确保模型元数据准确反映序列结束标记是关键步骤。实施结构化输出约束,例如 JSON 模式,也可以防止评估工具中出现输出截断等问题。
- llama.cpp 如何管理大型模型的 VRAM 限制?
- llama.cpp 擅长管理 VRAM 限制,当 GPU 内存不足时,它会智能地将模型层卸载到系统 RAM。虽然这可能导致推理速度比完全加载到 VRAM 中的模型慢,但它使得更大的模型(例如 70B 参数)能够在 VRAM 有限的消费级硬件(例如 4GB GPU)上运行。与 vLLM 等竞争对手相比,vLLM 在超出 VRAM 限制时通常会失败,而 llama.cpp 的这一能力提供了显著优势。
相关
-
MTPLX 和 llama.cpp+MTP 在 macOS 上运行 Qwen3.8-27B 的基准测试中领先
Reddit r/LocalLLaMA 版块的一位用户进行了广泛的基准测试,以确定在 macOS 上运行 Qwen3.8-27B 模型最快、最高效的引擎。经过五天和超过 100 小时的 GPU 测试,该用户发现 MTPLX 和支持 MTP(Metal Tensor Parallelism)的 llama.cpp 在代理编码任务方面提供了最佳性能。基准测试包括简短的合成测试、复杂的、多阶段的代理编码挑战以及预填充速度测试。
-
FreeToken 使大型 MoE 模型能在单台工作站 GPU 上运行
来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 FreeToken,这是一个原生于边缘的混合专家(MoE)服务引擎,旨在单台工作站 GPU 上运行大型语言模型。该系统通过将个人机器视为统一的推理平台,解决了在消费级硬件上部署 GLM-5.2(753B 参数)等强大模型的挑战。FreeToken 优化了可用 GPU、CPU 和内存资源之间的计算和模型状态映射,使得通常需要数据中心级基础设施的模型能够实现交互式速度。该引擎…
-
Kimi K3 LLM 使用 8 个 B300 GPU 托管,达到 92 token/秒
一位用户详细介绍了他们使用八个 B300 GPU 托管拥有 2.8 万亿参数的 Kimi K3 大型语言模型的经验。该设置实现了每秒 92 token 的吞吐量,首次 token 时间约为 1 秒,每百万输出 token 的成本为 190 美元。用户还尝试了 Unsloth 的 Dynamic GGUF,发现其速度明显较慢,每 token 成本更高,尽管质量被认为是可接受的。
-
Linux 将本地 LLM 速度提升高达 50%,优于 Windows
一位用户报告称,在运行本地大型语言模型时,从 Windows 切换到 Linux 带来了显著的性能提升。通过将 Windows 上的 llama.cpp 迁移到 Linux 上的 vLLM,用户体验到了 30-50% 的速度提升。这表明 Linux 可能为某些本地 LLM 推理任务提供了更优化的环境。
-
用户为本地硬件优化dsv4-flash-0731模型
Reddit的r/LocalLLaMA子版块的一名用户详细介绍了他们在128GB RAM和约60GB VRAM的系统上运行dsv4-flash-0731模型的4位量化版本的实验。尽管由于硬件限制和模型大小超出可用RAM导致初始的token生成和提示处理速度缓慢,该用户实施了几项优化。这些优化包括修补llama.cpp以更有效地管理内存,将模型专家固定到主机RAM,以及采用一种新颖的方法,专门使用较低量化精度的模型进行提示处理以提高速度。
-
DFlash 2 在 llama.cpp 基准测试中将 Qwen 3.8 27B 的速度提升了 2.26 倍
一位用户在使用 llama.cpp 中的 DFlash 2 推测解码方法,并以 Qwen 3.8 27B 模型为对象进行了基准测试。结果显示,在没有额外方法的情况下,真实世界的编码提示速度提升了 2.26 倍;与 n-gram 查找表结合使用时,速度提升高达 4.68 倍。基准测试还指出,DFlash 2 比其前代产品需要更少的 VRAM,并且推测解码的某些配置参数表现不如预期。
-
用户警告单独使用本地大语言模型存在心理风险
一位 Mastodon 用户分享了对越来越多的人在个人电脑上使用本地大语言模型(LLMs)这一趋势的担忧。该用户自2023年末开始探索此领域,警告了长期单独使用可能产生的心理影响,特别是对于那些容易被印象深刻或难以区分虚构与现实的人。他们强调了与现实保持联系的重要性,并告诫不要过度依赖人工智能来解决问题或执行认知任务。
-
为 AMD GFX906 GPU 发布的 llama.cpp 分支优化
llama.cpp 项目的一个分支已被开发出来,以优化在 AMD GFX906 GPU 上的性能。这个优化版本旨在提高在特定 AMD 硬件(包括 MI50、MI60 和 Radeon VII 显卡)上运行大型语言模型的效率。开发者正在寻求对这一专门实现的反馈。
-
NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍
一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。
-
AI PC 组建者在 RTX 3090 显卡失败后寻求新显卡
一位为公司应用构建预算型 AI PC 的用户在使用 llama.cpp 进行约一小时的测试后,两块 RTX 3090 GPU 在负载下均出现硬件故障。该用户现在正在寻求价格相似的新 GPU 推荐,考虑选项包括两块 RTX 5060 Ti、一块 AMD Radeon R9700 或一块 Asrock Arc Pro B70,重点关注 24/7 运行的可靠性以及未来扩展的可能性。
-
llama.cpp 采用语义化版本控制以增强稳定性
llama.cpp 项目发布了 0.2.0 版本,正式采用语义化版本控制以提高 API 和 ABI 的稳定性。此更改也适用于底层的 ggml 库,旨在为开发人员提供更清晰的向后兼容性预期,从而简化集成 llama.cpp 的应用程序的依赖管理。此次更新对于依赖 llama.cpp 进行本地 AI 推理的应用程序和库的开发人员尤其有利,有望带来更强大、更可预测的生态系统。
-
用户寻求帮助以优化 llama.cpp 的多 GPU 大型语言模型推理
Reddit r/LocalLLaMA 版块的一名用户正在寻求帮助,以配置 llama.cpp 来有效利用多个 GPU 运行大型语言模型。他们在尝试将一个 120GB 的 Deepseek4 flash 模型分配到 Blackwell 5000 (48GB) 和 3090 (24GB) GPU 上时遇到了性能问题,并注意到性能没有如预期般提升,有时甚至会下降。用户详细介绍了他们的设置、模型大小以及尝试过的各种命令行标志组合,包括不同的…
-
离线AI安全扫描器通过多阶段流水线避免LLM幻觉
一款名为AiSec Studio的新型AI安全扫描平台已被开发出来,以解决大型语言模型(LLM)产生幻觉的问题。与将原始数据直接输入LLM的传统AI扫描器不同,AiSec Studio采用了多阶段流水线。该流水线首先使用确定性解析器和规则引擎来识别潜在漏洞,然后填充知识图谱。只有在完成这些步骤后,本地LLM才会处理结构化的发现摘要,以提供解释和推理,而不是自行发现漏洞。这种方法旨在提供更准确、可审计的安全报告。
-
llama.cpp 发布 0.2.0 版本,新增 Web UI
开源项目 llama.cpp 已发布 0.2.0 版本,在其 nightly build 中包含了一个 Web UI。此次发布获得了社区的极大关注,其在 GitHub 上已获得 125,029 颗星。该项目继续成为本地运行大型语言模型的流行工具。
-
Reddit用户讨论最适合编码和通用用途的本地AI工具
Reddit上的r/LocalLLaMA子版块正在讨论最适合编码和通用用途的本地AI工具。用户正在寻求能够有效运行Qwen和Ornith等开源模型的软件推荐,希望摆脱对OpenAI的GPT-3.5和GPT-4或Anthropic的Claude Code等云端选项的依赖。讨论强调了模型能力可能因不佳的工具或函数调用设置而受阻,参与者分享了他们偏好的配置,包括llama.cpp等推理后端和必备工具。
-
Swarm项目在单一Rust运行时中统一了AI网关和代理框架
Swarm是一个用Rust构建的AI基础设施项目,旨在将网关和代理框架功能统一到单一运行时中。这种方法允许开发人员从多提供商路由的基本网关功能开始,并逐步添加更复杂的代理功能,而无需进行架构上的重大调整。Swarm支持各种LLM提供商和本地模型,原生管理对话状态,并与模型上下文协议(MCP)集成以执行工具。
-
Muse Glimmer 支持在消费级 GPU 上进行本地 AI 编码代理开发
Muse Glimmer 是一款新的开源工具,支持在本地开发 AI 编码代理。它利用了 llama.cpp、DFlash 推测解码和 Raspberry Pi 等技术。该工具设计用于在消费级 GPU(如 RTX 3090)上运行,使个人电脑也能实现代理式 AI。
-
Unsloth Dynamic V3 在 8GB RAM 上将 Qwen3.8-27B 的准确率提高 10%
Unsloth 发布了 Dynamic V3,一种新的量化技术,可在不增加文件大小的情况下提高模型准确率。这项进展使 Qwen3.8-27B 等模型在保持相同大小的情况下准确率提高 10%,甚至使 1 位版本能够以低至 8GB 的 RAM 运行。该技术通过改进校准数据集、优化压缩层选择以及利用训练后量化来实现。这一发展对于本地 AI 运动具有重要意义,使大型模型在消费级硬件上更易于访问,并挑战了模型压缩必然导致质量下降的观念。
-
llama.cpp 集成 VictoriaMetrics 以增强监控
本文详细介绍了如何使用 VictoriaMetrics 为 llama.cpp 项目实现指标和监控。它提供了设置服务器以收集和分析 llama.cpp 性能数据的指南,从而更好地了解其运行情况。
-
llama.cpp V cache quantization 需要 flash_attn,影响上下文窗口计算
llama.cpp 项目有一个配置要求,即“V cache quantization”(V 缓存量化)需要使用“flash_attn”。这种联系通常被忽视,源于系统内部的内存布局决策。理解这种依赖关系对于准确计算可用上下文窗口至关重要,一位开发者发现,由于交错的注意力层,像 Gemma-family 12B 这样的模型的标准元数据计算是不准确的,这证明了这一点。该开发者通过使用小上下文启动 llama.cpp 并解析其运行时日志来确定…