llama-cpp-python
PulseAugur coverage of llama-cpp-python — every cluster mentioning llama-cpp-python across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
本地 LLM 服务器模拟 OpenAI API,按 VRAM 自动选择模型
一位开发者创建了一个本地 LLM 服务器,提供兼容 OpenAI 的 API,允许用户在自己的硬件上运行各种 GGUF 模型。该系统使用 llama.cpp 进行推理,FastAPI 作为服务器,并配备了一个 VRAM 感知路由器,可根据可用 GPU 内存自动选择最合适的模型。此设置旨在提供一种经济高效且注重隐私的云端 LLM 服务替代方案。
-
Microsoft 发布 VibeVoice-ASR-BitNet 以实现实时 CPU 推理
Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。
-
Qwopus3.6-27B-Fusion-GGUF 模型可用于本地 AI 推理
KyleHessling1/Qwopus3.6-27B-Fusion-GGUF 模型现已在 Hugging Face 上提供,为用户提供了本地 AI 推理的新选择。该模型与多种流行库和应用程序兼容,包括 llama-cpp-python、llama.cpp、LM Studio、Jan、vLLM 和 Ollama。提供了详细的说明和代码片段,以方便与这些工具集成,使用户能够在自己的硬件上运行该模型。
-
Hugging Face 托管 Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF 并提供集成指南
Qwen 模型的一个特定版本,名为“DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF”,已在 Hugging Face 上提供。该模型附带详细的集成说明,可与包括 llama-cpp-python、llama.cpp、vLLM 和 Ollama 在内的各种流行库和应用程序集成。这些指南为用户提供了代码片段和命令,以便于本地部…
-
Mac 内核崩溃由大语言模型切换错误引起
一位开发者遇到了一个严重问题,在 Mac 上切换两个大语言模型时导致了内核崩溃,整个系统重启。问题源于 Apple Silicon 上 llama.cpp Python 绑定的内存管理,释放模型时并未释放其有线内存。这导致在尝试加载第二个、更大的模型时,系统可用内存耗尽,引发看门狗超时和内核崩溃。修复方法是重启应用程序的后端进程,而不是尝试就地模型交换,以确保所有内存都得到正确释放。
-
Unsloth 发布两款针对本地部署优化的新型 LLM
Unsloth 发布了两款新型模型:unsloth/Laguna-S-2.1-GGUF 和 unsloth/Ornith-1.0-35B-GGUF,它们针对高效的本地部署进行了优化。这些模型兼容多种流行的推理库和应用程序,包括 Hugging Face Transformers、llama-cpp-python、llama.cpp、vLLM 和 LM Studio。提供了详细的说明和代码示例,用于将这些模型集成到不同的工作流程中,从 …
-
Qwen3.6-27B-Fable-Fusion 模型现已支持 Llama.cpp, vLLM, Ollama
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 模型现已可用于各种流行的库和应用程序。提供了使用 llama-cpp-python, llama.cpp, vLLM 和 Ollama 等工具进行集成的说明。该模型还支持 LM Studio 和 Jan 等本地应用程序,并包含易于实现的示例和代码片段。
-
unsloth/inkling-GGUF 模型现已在多个 AI 平台可用
unsloth/inkling-GGUF 模型现已可用于 llama-cpp-python、llama.cpp、vLLM 和 Ollama 等各种库和推理提供商。提供了将模型集成到 Google Colab 和 Kaggle 笔记本以及 LM Studio 和 Jan 等本地应用程序的说明。Unsloth Studio 还提供直接集成以与模型进行聊天。
-
AngelSlim/Hy3-GGUF 模型现已支持多种 AI 工具和库
AngelSlim/Hy3-GGUF 模型现已可与各种流行的 AI 工具和库配合使用。提供了将其与 llama-cpp-python、llama.cpp、vLLM、Ollama、Unsloth Studio 和 Pi 集成的说明。这些集成允许用户在本地或通过兼容的服务器运行模型,并为每个平台提供了详细的特定命令和设置指南。该模型还兼容推理提供商以及 Google Colab 和 Kaggle 等笔记本。
-
Hugging Face 发布新版 Qwen 模型,支持广泛集成
Qwen 模型的新版本,具体为 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF,已在 Hugging Face 上发布。该模型设计用于与多种库和推理提供商集成,包括 llama-cpp-python、llama.cpp、vLLM 和 Ollama。提供了集成此模型到不同开发环境和应用程序的说明和代码片段,使用户能够在本地或通过云平台运行它。
-
Hugging Face 发布了新的未审查版 Qwen3.6-35B 模型
一个名为 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF 的新版未审查 Qwen3.6-35B 模型已在 Hugging Face 上发布。该模型旨在兼容各种推理库和应用程序,包括 llama-cpp-python、llama.cpp、vLLM 和 Ollama。提供了集成此模型到不同工作流程的说明和代码片段,使用户能够将其在本地或通过云平台运行。
-
Hugging Face 发布新的 Qwen3.6-35B 模型,支持广泛集成
一个名为 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF 的新模型已在 Hugging Face 上发布,为用户提供了与各种库和应用程序集成的说明。该模型与 llama-cpp-python、llama.cpp、LM Studio、Jan 和 vLLM 等流行工具兼容,便于在不同的推理环境中使用。提供了详细指南,用于在本地或通过 Google Colab 和 …
-
Empero AI 发布 Qwythos-9B-v2,修复循环行为并保留推理能力
Empero AI 发布了其 Qwythos 模型的更新版本 Qwythos-9B-v2。新版本解决了先前版本中存在的循环行为问题,将其发生率从 6.7% 降低到 0%,同时不损害推理能力。该模型保留了其深度思维链、无审查的研究立场和 1M token 上下文窗口,并恢复了其原生多 token 预测模块。
-
Unsloth 发布 DeepSeek-V4-Flash 模型 GGUF 版本以供本地使用
Unsloth 发布了 DeepSeek-V4-Flash 模型 GGUF 版本,使其可用于本地部署。该模型可与多种工具和库集成,包括 llama-cpp-python、llama.cpp、LM Studio、Jan 和 Ollama。为每次集成提供了说明和配置,使用户能够在 Raspberry Pi 等设备上运行该模型,并将其与 Pi 和 Hermes 等代理一起使用。
-
Prism ML 发布 Bonsai 1位和三元组格式模型
Prism ML 发布了其 Bonsai 27B 模型的两个版本:一个使用1位二进制权重,另一个使用三元组权重。1位 Bonsai 模型专为 iPhone 17 Pro Max 等移动设备优化,占用的空间显著减少,约为 3.9 GB,同时保留了约 90% 的 FP16 智能。三元组版本专为日常笔记本电脑设计,占用空间稍大,约为 7.2 GB,但实现了 95% 的 FP16 智能和更快的推理速度。
-
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF 模型发布并附带集成指南
一款名为 MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF 的新模型已在 Hugging Face 上发布。该模型为 GGUF 格式,并提供了使用各种库和应用程序(包括 llama-cpp-python、llama.cpp、vLLM、Ollama 和 Unsloth Studio)的说明。这些资源详细介绍了如何在本地或通过云服务设置和运行模型的推理。
-
Poolside 发布 Laguna S 2.1,支持 100 万上下文和智能体能力 · 跟踪 4 个来源
Poolside 发布了 Laguna S 2.1,这是一个拥有 1180 亿参数、每个 token 激活 80 亿参数的混合专家模型。该模型专为智能体编码和长时任务设计,拥有 100 万 token 的上下文窗口和交错注意力机制。提供了包括 NVFP4 和 GGUF 在内的多种量化版本,可用于本地部署,并与 transformers、vLLM 和 llama.cpp 等流行库集成。
-
InternScience/Agents-A1-Q4_K_M-GGUF 模型已集成多种 AI 工具
InternScience/Agents-A1-Q4_K_M-GGUF 模型现已可与各种流行的 AI 工具和库一起使用。提供了将其与 llama-cpp-python、llama.cpp、LM Studio、Jan、Ollama 和 Unsloth Studio 集成的说明。此外,用户还可以利用该模型与 Google Colab 和 Kaggle 笔记本电脑,以及在 Raspberry Pi 设备上。该模型还支持与 Hermes Ag…
-
bottlecapai 在 Hugging Face 上发布多模态 Qwen3.6-27B 模型
基于 Qwen3.6-27B 的 bottlecapai/ThinkingCap-Qwen3.6-27B 模型现已在 Hugging Face 上可用。它提供多模态能力,允许用户处理文本和图像。该模型可以与各种库和推理提供商集成,包括 Transformers、vLLM、SGLang 和 llama.cpp,并为每种提供商提供了详细说明。
-
MaralGPT/MaralGPT-Mythos-9B-2606-GGUF 模型现已可供集成
MaralGPT/MaralGPT-Mythos-9B-2606-GGUF 模型现已可与各种流行库和推理提供商一起使用。提供了将模型与 Transformers、llama-cpp-python 和 vLLM 等工具集成的说明。此外,用户还可以使用 LM Studio 和 Jan 等本地应用程序,或通过 Google Colab 和 Kaggle 等平台上的笔记本部署该模型。