GGML
PulseAugur coverage of GGML — every cluster mentioning GGML across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
llama.cpp 的核心是 GGML,一个用于 CPU 推理的 C 语言库
llama.cpp 项目是运行大型语言模型在消费级硬件上的流行工具,它建立在一个名为 GGML 的基础 C 语言库之上。GGML 由 Georgi Gerganov 创建,它既是一个轻量级的张量计算引擎,也是一个为 CPU 和激进量化优化的模型存储格式。这种设计使得像 Meta 的 LLaMA 这样的模型能够在普通笔记本电脑上高效运行,而无需 GPU 或大量的 Python 依赖。GGML 格式及其后继者 GGUF 对于通过内存映射快…
-
llama.cpp 采用语义化版本控制以增强稳定性
llama.cpp 项目发布了 0.2.0 版本,正式采用语义化版本控制以提高 API 和 ABI 的稳定性。此更改也适用于底层的 ggml 库,旨在为开发人员提供更清晰的向后兼容性预期,从而简化集成 llama.cpp 的应用程序的依赖管理。此次更新对于依赖 llama.cpp 进行本地 AI 推理的应用程序和库的开发人员尤其有利,有望带来更强大、更可预测的生态系统。
-
FlashAttention-V 助力向量架构上的 Transformer 推理
研究人员开发了 FlashAttention-V,这是 FlashAttention 为可扩展向量架构量身定制的优化版本。该新方法旨在提高 Transformer 模型(特别是小型语言模型 SLM)在新兴向量硬件上的效率。FlashAttention-V 通过融合操作、利用注意力头之间的并行性以及增强内存局部性,实现了显著的加速,在特定硬件配置上,预填充速度提升高达 42 倍,解码速度提升高达 11 倍。
-
Open AI 模型分发层增长速度是核心模型的 7 倍
开源 AI 模型生态系统的分发层正在经历快速增长,其速度超过了模型本身的开发速度。Hugging Face 报告称,尽管模型库在 2026 年前七个月增长了 21.5%,但使用 GGUF 格式的库却增长了 464%。这表明,模型打包和转换为可运行格式(通常由 Unsloth 等第三方发布者完成)的普及程度远超原始实验室的直接发布。企业可能会在不知情的情况下采用这些社区生产的产物,从而引发关于来源和标准化的疑问。
-
Hugging Face 集成 GGML 和 llama.cpp 以支持本地 AI 开发
Hugging Face 宣布集成了 GGML 和 llama.cpp,这两个是在消费级硬件上本地运行大型语言模型(LLM)的关键项目。此举旨在确保本地 AI 能力的长期发展和可访问性。此外,Hugging Face 还重点介绍了 LFM2.5 编码器,它能够在 CPU 上实现快速的长上下文推理,进一步增强了 AI 模型在无需专用硬件的情况下的可用性。
-
Microsoft 发布 VibeVoice-ASR-BitNet 以实现实时 CPU 推理
Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。
-
audio.cpp 0.4 增加 TTS/ASR 模型,支持完整 GGUF
audio.cpp 项目已发布 0.4 版本,引入了对多种新的高质量文本转语音 (TTS) 和自动语音识别 (ASR) 模型支持,包括 Higgs Audio v3 TTS 4B 和 Fish Audio S2 Pro。此版本还全面集成了 GGUF 格式支持所有模型家族,提供了显著的速度和 VRAM 提升,尤其是在 Q8 量化方面。该项目现支持 35 个模型家族,并新增了社区模型区域以支持更成熟的移植。
-
Transcribe.cpp:新的基于 GGML 的开源语音转文本库发布
Transcribe.cpp 是一个基于 GGML 的新的开源语音转文本库。它支持广泛的模型,提供数值验证和 WER 测试以确保准确性。该库通过 Vulkan、Metal 和 CUDA 提供跨平台 GPU 加速,确保快速且私密的转录,将音频数据保留在用户的硬件上。
-
Hugging Face整合GGML和llama.cpp以推进本地AI
Hugging Face宣布GGML和llama.cpp将加入其平台。此次整合预计将促进本地AI能力的长期发展。此举标志着对支持开源AI开发以及使强大AI模型更容易在本地执行的承诺。
-
TurboQuant AI 压缩获得社区采用,但热度有所降温
在谷歌宣布 TurboQuant 算法用于压缩 AI 模型 KV 缓存四个月后,该算法已获得社区的广泛采用,但对其能力的理解更为细致。尽管谷歌尚未发布官方代码,但已涌现出许多独立实现,将该算法适配到各种框架和模型中。早期关于显存减少 6 倍和加速的炒作已被社区评估所缓和,评估表明虽然可以实现压缩,但准确性可能会受到影响,尤其是在较低的比特宽度下,而在新硬件上,纯 FP8 KV 缓存可能更受欢迎。
-
开源AI管线可在本地生成游戏资产
一位开发者创建了一个使用开源AI模型在本地生成游戏资产的完整管线,并已移植到GGML以实现本地执行。该管线包括用于文本转语音及语音克隆(OpenMOSS)、音效生成(ThinkSound.cpp)以及最先进的3D模型生成(Trellis.2)的工具。这些工具已集成到Lemonade SDK中,通过级联模型实现文本到3D生成等复杂工作流。整个系统基于宽松的开源许可证构建,并支持CUDA、Vulkan和ROCm以实现广泛的硬件兼容性。
-
TensorSharp 增加 Vulkan 后端以进行 LLM 推理,并与 llama.cpp 进行基准测试
TensorSharp,一个开源 LLM 推理引擎,发布了其 GGML Vulkan 后端的初始版本,旨在提高 GPU 上的性能。该更新已在 Nvidia 和 Intel GPU 上成功测试,开发者正在寻求 AMD GPU 用户反馈。将 TensorSharp 的 Vulkan 后端与 llama.cpp 进行的基准测试显示结果不一,TensorSharp 在某些场景下更快,而在其他场景下(尤其是首次标记时间)则较慢。
-
audio.cpp 通过 C++/GGML 添加音乐、SFX 和长篇 TTS 模型
audio.cpp 项目发布了重大更新,引入了对 ACE-Step、Stable Audio、HeartMuLa、RoFormer 和 HTDemucs 等新音频模型的原生 C++/GGML 支持。此次扩展支持音乐和 SFX 生成以及声源分离,其中一些模型现在能够生成长达10分钟的音频。此外,还集成了 VibeVoice 1.5B,在长篇 TTS 方面表现出色,在 RTX 5090 上不到23分钟即可生成90分钟的音频,显著优于基于 …
-
GGML 和 llama.cpp 加入 Hugging Face,以促进本地 AI 发展
Hugging Face 已宣布 GGML 和 llama.cpp 加入其平台。此次整合旨在确保本地 AI 模型的长期发展和可访问性。此举预计将为在消费级硬件上运行 AI 模型提供稳定基础,从而惠及社区。
-
便携式AI代理现可从340MB的U盘包运行
一个名为norax-portable的新项目支持创建独立的AI代理,这些代理可以从U盘在任何x86_64 Linux机器上运行。该软件包仅340MB,包含Python、Ollama(仅CPU)和内存组件,无需系统依赖。这使得便携式AI应用程序能够在会话之间保持内存持久性并提供HTTP API。
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。
-
Hugging Face 集成 GGML 和 llama.cpp 以支持本地 AI 开发
Hugging Face 已宣布 GGML 和 llama.cpp 将加入其平台。此次集成预计将确保本地 AI 功能的长期发展。此举标志着对支持开源 AI 开发以及使强大 AI 工具更易于访问的承诺。
-
NVIDIA Parakeet 语音转文本已移植到 ggml,以实现更快的 CPU/GPU 使用
一位开发者已成功将 NVIDIA 的 Parakeet 语音转文本模型移植到 ggml 框架,使其能够在没有 Python 或 PyTorch 的情况下高效地在 CPU 和 GPU 上运行。此移植实现了与 NVIDIA 的 NeMo 模型逐字节相同的输出,在 GPU 上速度提升高达 5 倍,在 CPU 上速度提升 1.86 倍,同时还减少了内存使用。量化的 GGUF 版本已可用,该项目包含一个 C-API 以实现广泛集成,甚至通过 L…
-
开发者使用 Vulkan 在 50 美元的 AMD RX 580 GPU 上运行 LLMs
一位开发者展示了如何在拥有 8GB 显存的旧款 AMD RX 580 GPU 上运行大型语言模型和图像生成软件,这在以前被认为是不可能的壮举。通过利用为 ggml 项目(支持 llama.cpp 和 stable-diffusion.cpp 等工具)提供的 Vulkan 后端,该开发者实现了比仅使用 CPU 处理高出 3-4 倍的性能。这种方法绕过了对 CUDA、ROCm 或 DirectML 的需求,证明了现代 AI 任务可以在更普…
-
Google的Gemma 4增加了MTP以加快本地推理速度,VibeVoice已移植到C++,Ollama获得桌面层
Google发布了Gemma 4,其中包含多令牌预测(MTP)功能,该功能允许模型同时预测多个令牌,从而显著加快本地推理速度。此外,使用ggml库开发了Microsoft VibeVoice模型的C++端口vibevoice.cpp,无需Python即可在消费级硬件上实现先进的语音到文本和文本到语音功能。还有一个独立项目正在进行中,旨在为Ollama创建一个离线的、低内存占用的桌面应用程序,以简化对技术水平较低用户的本地LLM部署。