ggerganov
PulseAugur coverage of ggerganov — every cluster mentioning ggerganov across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
llama.cpp 增强测试套件以实现更广泛的模型兼容性
llama.cpp 项目发布了更新 b10666,其中包含对其测试套件的重大改进。一项关键的变更是将 `test-save-load-state` 功能扩展到覆盖指定目录中的所有架构和模型,而不仅仅是单个模型。此次更新还解决了 `deepseek4`、`gemma2`、`minimax-01` 和 `dsv4` 等不同模型架构中的各种问题,以确保兼容性和正确的状态保存/加载。此外,还对 dummy DSA 索引器进行了优化,以更好地与…
-
Qwen3.8-27B 模型变体在 Hugging Face 上发布,附带多种集成指南
Hugging Face 上现已提供 Qwen3.8-27B 模型的多个社区上传版本,包括未经审查的版本。这些模型附带了与 llama.cpp、vLLM、Ollama 和 Unsloth Studio 等流行推理工具集成的说明。提供多种量化格式,以满足不同硬件能力和用户本地部署偏好的需求。
-
Kivarro:发布新的基于 Rust 的 GGUF 模型工作台
一款名为 Kivarro 的新桌面应用程序已发布,该应用程序使用 Rust 和 Tauri 构建,旨在帮助用户在无需安装 Ollama 的情况下与 GGUF 模型文件进行交互。Kivarro 由一位独立开发者开发,于 2026 年 7 月 5 日发布,提供三个主要功能:检查模型元数据、与模型聊天以及设置本地 API。该应用程序还包括一个硬件匹配检查功能,用于在下载模型之前确定模型是否可以加载到可用内存中。Kivarro 的源代码是公开…
-
llama.cpp 优化 Gemma-4 的 KV 缓存性能
llama.cpp 项目已合并一个优化 KV 缓存性能的拉取请求,特别是针对 Gemma-4 模型。此更改在 b9551 及更高版本中可用,旨在减少与 KV 单元相关的内存复制。该优化于昨天合并,预计将提高在本地硬件上运行的兼容模型的推理速度。
-
llama.cpp b9501 重构 state 保存测试以支持 token 输入
llama.cpp 项目发布了 b9501 版本,其中对其 test-save-load-state 功能进行了重构。此次更新允许测试接受 token 输入,如果未提供 prompt,则默认生成随机 token,这对于缺少分词器的模型很有益。更改还涉及提前分词以及使用新的 API 函数访问词汇表。
-
llama.cpp 增加评估工具;MagicQuant v2.0 提供混合 GGUF 量化
llama.cpp 项目引入了 llama-eval,一个用于根据标准数据集对本地语言模型进行基准测试的新工具。同时,MagicQuant v2.0 发布了先进的混合 GGUF 量化技术,并与 Unsloth 集成以优化模型压缩。此外,一个名为 Needle 的新 26M 参数开源模型已发布,专为在消费级硬件上进行高效的本地工具调用而设计。