PulseAugur
实时 18:14:55
实体 Q4_K

Q4_K

PulseAugur coverage of Q4_K — every cluster mentioning Q4_K across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_199486 ·

    Ollama create:深入了解构建自定义 LLM

    Ollama 的 `create` 命令充当模型编译器,接收 Modelfile 来构建自定义语言模型。它解析基础模型,将指令处理成内容寻址层,并生成清单。这种基于层的处理方式可以实现高效重建,因为只需要重新处理更改的参数。该命令支持各种自定义标志,包括指定 Modelfile、将模型量化为 Q8_0 或 Q4_K 等格式,以及用于 Safetensors 的实验性功能。

  2. TOOL · CL_193709 ·

    新的量化方法可实现大型MoE模型的高效服务

    研究人员开发了一种名为Tied Trit-Planes (PTQTP) 的新型量化技术,将LLM权重矩阵约束为统一的九级量化器。该方法允许将两个三进制平面无损地折叠成单个4位代码平面,作为用于磁盘流式传输的混合专家模型的持久表示。将其应用于DeepSeek-V4-Flash-0731后,与4.5位基线相比,文件大小更小,解码速度更快,并且在MMLU等基准测试上的性能相当或有所提高,尽管权重重建误差较高。

  3. RESEARCH · CL_145650 ·

    ExTernD 技术在较低比特宽度下为 LLM 提供接近 bf16 的精度 · 跟踪 4 个来源

    研究人员开发了 ExTernD,一种用于大型语言模型 (LLM) 的新型训练后量化技术。该方法将 LLM 权重矩阵分解为三元因子和一个对角缩放向量,从而扩展了内部秩以纠正量化误差。ExTernD 在 Gemma-4-E2B 和 Qwen3.5-4B 等模型上,展示了与 Q4_K 和 Q5_K 等更高比特宽度量化方法相当的精度,同时保持了高效的内存和计算使用。

  4. COMMENTARY · CL_82458 ·

    LLaMA subreddit 用户询问 GGUF 量化精度

    一位 r/LocalLLaMA subreddit 的用户正在寻求关于大型语言模型不同 GGUF 量化格式所提供精度的澄清。他们正在特别比较 NVFP4 与 Q4_K 和 Q6_K,并注意到网上存在相互矛盾的信息。用户根据其研究得出的当前理解表明,精度等级为 Q6_K 优于 NVFP4,而 NVFP4 又优于 Q4_K。