GGUFs
PulseAugur coverage of GGUFs — every cluster mentioning GGUFs across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Qwen3.8-Flash-Next 模型发布,采用专家剪枝和先进量化技术
Qwen3.8-Flash-Next 模型的新版本现已发布,采用了 GSQ 和 RCO 等先进量化技术。这些模型在保持性能的同时显著减小了尺寸,其中一个版本在每参数 3.50 比特的情况下达到了基础模型 93.26% 的性能。一个专门的“Coder”版本通过移除模型一半的专家进一步优化,产生了 29.6 GB 的常驻工作集,可以在单个 32 GB 加速器上运行,同时仍保留其超过 90% 的编码基准能力。
-
Ornith 1.5 35B GGUF 模型权重发生变化,迎来细微更新
Reddit r/LocalLLaMA 版块的一名用户发现 Ornith 1.5 35B GGUF 模型文件进行了细微更新。该用户发现权重本身发生了变化,同时重要性矩阵和校准元数据也发生了改变。此外,文件标签也得到了清理,添加了“license”和“tags”等新字段,同时移除了一些之前的版本字段。尽管有这些变化,模型的架构、分词器和上下文长度保持不变,这表明是重新量化而非模型本身的根本性改变。
-
Unsloth 发布 Dynamic 3.0 GGUFs 以优化 LLM 性能
Unsloth 发布了 Dynamic 3.0 GGUFs,这是对其模型优化工具的更新。此次发布专注于提高大型语言模型的效率和性能。GGUF 格式广泛用于在消费级硬件上运行模型,Unsloth 的优化旨在使这些模型更易于访问且运行更快。
-
Unsloth 发布 Qwen3.8-27B 的 Dynamic v3 量化版本,准确性得到提升
Unsloth 发布了 Qwen3.8-27B GGUFs 的 Dynamic v3.0 量化版本,与其他提供商相比,在相同模型大小下准确性提高了 10% 以上。新版本采用改进的方法,使用更高质量的 imatrix 校准数据集和增强的量化技术,同时避免了 QAT 或 QAD。该版本包括保留显著准确性且体积更小的 1 位量化版本,非常适合内存有限的系统。
-
阿里巴巴发布 Qwen3.8-27B 模型;AI 助力 GPU 移植;LLM 基础设施详解
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个拥有 270 亿参数的密集模型,可容纳在单个 GPU 上,并支持 100 万 token 的上下文窗口,在 vLLM 中实现了 Day-0 集成。同时,研究正在探索 AI 辅助的 GPU 移植技术,用于遗留科学应用程序,展示了显著的速度提升和数值验证。此外,还详细介绍了 LLM 的 GPU 基础设施的更广泛格局,涵盖了硬件选项和优化技术,如连续批处理和层流式处理,以最大…
-
Hy3 LLM 集成到 llama.cpp 并支持 GGUF
Hy3 大型语言模型已发布,并通过新的拉取请求集成到 llama.cpp 项目中。早期用户报告称能够成功生成连贯的输出,并分享了特定硬件设置的性能指标。此次集成利用了 GGUF 格式,该工作归功于拉取请求作者 satindergrewal。
-
Unsloth Studio 支持 GLM 5.2,上下文长度延长 3 倍
Unsloth Studio 发布了 0.1.47-beta 版本,引入了对 GLM 5.2 GGUFs 的支持以及改进的自动适应算法,可实现三倍长的上下文长度。此次更新还带来了增强功能,例如可分叉和可排队的聊天、重新设计的模型发现中心以及并行模块处理。安全增强功能包括支持 Cloudflare 的加密工作室模式以及为高级用户提供的绕过权限模式。
-
Command A Plus 语言模型已集成到 llama.cpp 中
Command A Plus 语言模型已集成到 llama.cpp 中,这是一个流行的用于大型语言模型的推理引擎。此次更新还包括对 North Mini Code 的支持。虽然可以通过 Unsloth 获取 North Mini Code 的 GGUF 量化版本,但用户已创建并分享了 Command A Plus 的更新 GGUF 文件,因为它们不易找到。
-
Qwen3.5 27B和35B未审查模型已发布
用户LLMFan46发布了Qwen3.5模型的两个未审查版本:一个27B参数模型和一个名为A3B的35B参数模型。这些模型有多种格式可供选择,包括Safetensors、GGUFs、NVFP4和GPTQ-Int4。用户澄清说,虽然Qwen3.5和Qwen3.6共享相同的架构,但Qwen3.5针对通用AI助手进行了优化,而Qwen3.6则面向代理和编码任务。