PulseAugur
中
实时 04:43:49
实体 GGUF

GGUF

PulseAugur coverage of GGUF — every cluster mentioning GGUF across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
225
90 天内 225
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

18 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_286543 ·

    微软整合本地 AI 模型并推广混合智能

    微软正在通过为 Windows ML 集成 llama.cpp 和 GGUF 模型的实验性支持来增强其 AI 功能。该公司还在推广“混合智能”方法,该方法结合了本地和云端 AI 处理,其中 Copilot 是一个可以与文件和 PC 操作交互的关键组件。此外,微软还发布了新的本地 AI 模型 MAI-Code-1.1-Flash,并提供支持 Microsoft Agent 365 等 AI 代理的部署和控制的服务。

  2. TOOL · CL_286015 ·

    Unsloth 添加了 Jev 风格决策模型训练和 ComfyUI 支持

    Unsloth 发布了更新,使用户能够将任何文本或视觉 LLM 转换为 Jev 风格的决策模型,将准确性从 30% 显著提高到 80%。新功能允许在 Unsloth 中直接训练、测试和导出这些决策模型。此外,此次发布还包括对 ComfyUI 扩散模型的原生支持、通过 INT8 ConvRot 增强的扩散性能以及在 Linux、Mac 和 Windows 上改进的沙盒功能。

  3. TOOL · CL_285571 ·

    llama.cpp 添加 GLM5-Next MTP 优化和 GGUF 加载

    llama.cpp 项目发布了更新 b11474,为 GLM5-Next 模型引入了重要的优化和功能。此次更新包括实现了一个多令牌预测 (MTP) 图,称为 NextN,通过修剪不必要的计算来提高效率。这些更改还解决了提取合同和共享尾部回滚问题,并引入了加载仅 MTP 或仅 trunk 的 GGUF 文件的能力,从而允许加载草稿模型。

  4. TOOL · CL_285166 ·

    Local AI Pro 简化了本地运行 LLM 的过程

    Local AI Pro v.1.0.6 是一款新的桌面应用程序,旨在简化在本地运行 GGUF 格式大语言模型的过程。该应用程序由 ZugZang 开发,旨在为用户提供一种快速简便的方式来开始与模型交互,而无需复杂的设置,如 Python 安装或 Docker 容器。它被定位为与 Ollama 和 LM Studio 等现有解决方案不同的工具,专注于用户友好性和即时可用性。

  5. TOOL · CL_283709 ·

    MoE模型的稀疏激活影响4位量化质量

    混合专家(MoE)模型尽管参数量巨大,但对于任何给定的token,仅使用其中一小部分参数。这种稀疏性意味着4位量化对MoE模型的影响与对密集模型不同。虽然MoE模型可以容忍对其较少使用的“专家”参数进行更激进的量化,但像路由器和始终激活的张量等关键组件需要更高的精度来维持准确性。混合精度量化技术,例如Unsloth的UD-Q4_K_XL,通过对“冷路径”参数应用较低精度,同时将“热路径”参数保持在较高精度,从而保留准确性,这种方法可以…

  6. RESEARCH · CL_283504 ·

    llama.cpp 添加 K2 Horizon dense 和 MoVA 模型支持

    llama.cpp 项目发布了更新 b11454,引入了对 K2 Horizon dense 模型及其 MoVA 变体的支持。此次更新包括模型加载、超参数和张量处理的重大更改,以及计算图的调整。此外,该版本还解决了 Unicode 处理问题,特别是零宽度非连接符和连接符字符,这些字符之前导致 Windows 加载失败。更新还整合了对 YaRN betas 的支持,并强制执行推理和工具调用的响应模式。

  7. TOOL · CL_283548 ·

    Ollama 与 llama.cpp:理解它们的关系和区别

    本文比较了 llama.cpp 和 Ollama,这是两个用于在本地运行大型语言模型的流行工具。文章澄清说,Ollama 本质上是 llama.cpp 的一个封装器,这意味着在使用相同模型时,它们的推理速度核心几乎相同。然而,由于 Ollama 固定了特定版本的 llama.cpp,因此在集成最新的引擎更新和功能方面,它落后于 llama.cpp。Ollama 通过一键式模型下载和硬件自动检测等功能提供了便利性,而 llama.cpp…

  8. TOOL · CL_283057 ·

    180B 参数 AI 模型通过量化在消费级硬件上运行

    名为 POCKET-Darwin-180B-GGUF 的 Darwin-180B-RSI 模型的量化版本已发布,使其无需专用 GPU 即可在消费级硬件上运行。这个 111 GB 的模型采用了专家混合(MoE)架构,这意味着其 1800 亿参数中只有一小部分在每个 token 生成时处于激活状态。该模型在具有足够 RAM 的 CPU 上可以达到每秒 21 个 token 的速度,或者在 RAM 较少的笔记本电脑上通过利用 SSD 加载权…

  9. TOOL · CL_282080 ·

    180B 人工智能模型通过 4 位量化在笔记本电脑上运行

    一种新方法允许一个拥有 1800 亿参数的模型 POCKET-Darwin-180B-GGUF 在没有专用 GPU 的消费级硬件上运行。这是通过模型的稀疏专家混合架构(每个 token 只激活其一部分参数)和选择性的 4 位量化过程(保留关键权重的准确性)相结合实现的。量化后的模型以 GGUF 格式提供,需要显著更少的存储和内存,使其能够在具有至少 8GB VRAM 的笔记本电脑上运行,甚至在具有足够 RAM 的迷你 PC 上运行,同…

  10. TOOL · CL_281263 ·

    FlipGate 工具衡量量化 LLM 中每个答案的翻转情况

    一款名为 FlipGate 的新工具已被开发出来,用于评估量化大语言模型(LLM)的每个答案的一致性,超越了传统的准确性指标。FlipGate 衡量量化模型与基线相比,将正确答案错误化的频率,从而为可接受的变异建立一个“噪声基底”。这种方法旨在识别可能被整体准确性分数掩盖的回归问题,确保生产系统的可靠性更高。

  11. TOOL · CL_279940 ·

    Infermeld 工具包支持在混合 AMD/NVIDIA GPU 上运行 GGUF 模型

    一款名为 Infermeld 的新开源 Linux 工具包已发布,旨在实现在 AMD 和 NVIDIA GPU 上运行单个 GGUF 模型。Infermeld 使用 llama.cpp 开发,旨在允许拥有现有混合 GPU 设置的用户协同利用其硬件。该实验性版本包括设备选择、运行时预检和可复现的构建说明等功能,但它适用于熟悉实验性 Linux 环境的用户,并且需要单独的模型权重。

  12. TOOL · CL_279356 ·

    使用llama.cpp通过专家卸载在RTX 4090上运行100B+ MoE LLM

    一份技术指南详细介绍了如何在单块RTX 4090等消费级GPU上运行大型混合专家(MoE)语言模型,特别是超过1000亿参数的模型。该方法被称为“专家卸载”,利用了MoE架构,其中每个token只激活模型参数的一个子集。这使得计算密集但间歇使用的“专家”层可以卸载到系统内存中,而持续访问的组件(如注意力机制)则保留在GPU上。该指南提供了硬件建议、llama.cpp工具的构建说明以及实现此卸载技术的命令行示例,并强调系统内存带宽是性能的关键因素。

  13. COMMENTARY · CL_278868 ·

    量化对大型语言模型的影响:解释质量与压缩

    dev.to 上最近的一篇讨论探讨了量化对大型语言模型的影响,特别是在 OpenCode Go 订阅服务的背景下。量化压缩模型权重以降低内存和计算需求,但其有效性因使用的方法和比特深度而异。虽然 Q8_0 和 Q5_K_M 等较高比特深度几乎保留了原始模型的所有质量,但 Q4_K_M,尤其是 Q2_K 等较低比特深度可能导致性能明显下降,这可能解释了用户对使用经过大量量化模型的服务的抱怨。

  14. TOOL · CL_278580 ·

    新的 WebGPU LLM 引擎已针对 llama.cpp 进行数值精度验证

    一个基于 WebGPU 的新型 LLM 推理引擎 quipullm 已被开发出来,并与成熟的 llama.cpp 库进行了严格的验证。该引擎完全用 WGSL 和 JavaScript 从头编写,直接在浏览器中运行,并支持标准的 GGUF 文件。验证侧重于数值精度而非主观文本质量,使用了合成模型,并将 token ID、最后一个 token 的 logits 和贪婪续写与 llama.cpp 的输出进行比较。这种方法可以检测到细微的错误…

  15. TOOL · CL_277573 ·

    Redis 创始人发布专注的本地 LLM 引擎 DwarfStar 4

    Redis 的创始人 Salvatore Sanfilippo 发布了 DwarfStar 4 (ds4),一个新的本地 LLM 推理引擎。与许多旨在广泛兼容模型的引擎不同,ds4 专注于少数模型,包括 DeepSeek V4、GLM 5.x 和 Qwen 3.8 Flash Next。这种专注的方法允许进行不对称量化和驻留磁盘的模型权重等优化,从而能够在高内存机器(尤其是配备 Apple Silicon 的 Mac)上高效运行。该引…

  16. TOOL · CL_277450 ·

    Ollama 0.35 聊天 bug 按字母顺序重新排序 JSON schema 键

    Ollama 0.35 版本在其聊天处理中引入了一项更改,可能导致 JSON schema 键按字母顺序重新排序。当模型通过“原生”路径处理时,会发生这种情况,该路径涉及使用 Go 的 map 结构解码和重新编码 schema。由于 Go map 以字母顺序存储键,因此原始声明顺序会丢失,如果顺序对模型的输出很重要,例如将推理放在答案之前,则可能导致问题。此 bug 很微妙,因为 JSON 仍然有效且可解析,但字段内的数据可能不正确。…

  17. TOOL · CL_277054 ·

    开发者使用 llama.cpp 为 512K 上下文调整 Qwen 3.8 27B

    一位开发者详细介绍了使用 llama.cpp 在本地运行 Qwen 3.8 27B 语言模型的自定义配置。该设置侧重于最大化系统资源,特别是在 MBP M5 上的 128 GB 统一内存,以实现 512K token 的上下文窗口。调整的关键参数包括用于更快 token 生成的推测解码、将大部分模型层卸载到 GPU,以及为多代理编码任务优化批处理和 CPU 使用。

  18. SIGNIFICANT · CL_276902 ·

    VIDRAFT 发布可在消费级笔记本电脑上运行的 180B LLM

    VIDRAFT 发布了 POCKET-Darwin-180B,这是其 1800 亿参数 Darwin-180B-RSI 模型的 4 位量化版本。该版本兼容 llama.cpp,可以通过利用稀疏专家混合路由和一种新颖的嫁接量化技术,在包括没有专用 GPU 的笔记本电脑在内的消费级硬件上运行。该模型的尺寸已从 360 GB 减至 111 GB,与传统的企业级 GPU 设置相比,能够以显著更低的硬件成本和系统 RAM 要求进行本地推理,同时…

  19. RESEARCH · CL_276923 ·

    18B LLM通过4位量化在消费级笔记本上运行,实现本地推理

    一种名为POCKET-Darwin-180B的新方法,可以在没有专用GPU的情况下,在消费级笔记本上运行一个拥有180亿参数的大型语言模型。这是通过4位GGUF量化实现的,将模型大小从360GB减少到111GB,使得使用大约1400美元的硬件即可进行本地推理。该开发还强调了对AI代码审查工具进行稳健测试的必要性,正如在同一段代码上对两家不同供应商的比较所示。

  20. TOOL · CL_276847 ·

    MTP 将大语言模型生成速度提升 56%,但引发了质量担忧

    在一台 RTX 3090 显卡上,使用 Qwen3.8-27B 模型进行了一项评估多模态预测 (MTP) 对大语言模型性能影响的实验。启用 MTP 后,生成吞吐量提高了 56%,部分任务速度提升了 20-40%。然而,一项特定的迁移任务显示出质量差异,启用 MTP 的运行生成的补丁不如标准生成正确。