PulseAugur
中
实时 13:44:10
实体 IQ1_M

IQ1_M

PulseAugur coverage of IQ1_M — every cluster mentioning IQ1_M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_187607 ·

    Unsloth 将 Kimi K3 LLM 压缩至 500GB 以下,提升性能

    Unsloth 发布了 Kimi K3 大型语言模型的几个版本,显著减小了文件大小。其中一个版本 IQ2_XXS 通过移除多语言能力并仅保留英语,将文件大小从 711GB 缩减至 478GB。初步测试表明,这个精简后的模型在编码任务上可能更准确,但仍需在受控条件下进行进一步验证。其他发布的版本包括 Q1_0(466GB)和 TQ2_0(551GB)。

  2. MEME · CL_172364 ·

    用户询问 IQ1_M 342GB Pruned Kimi K3 模型可用性

    r/LocalLLaMA subreddit 上的一位用户正在询问 IQ1_M 342GB Pruned Kimi K3 模型的性能和可用性。该帖子包含指向该模型 Hugging Face 存储库的链接,表明它是 Kimi K3 模型的社区开发或微调版本。

  3. TOOL · CL_143083 ·

    AngelSlim/Hy3-GGUF 模型现已支持多种 AI 工具和库

    AngelSlim/Hy3-GGUF 模型现已可与各种流行的 AI 工具和库配合使用。提供了将其与 llama-cpp-python、llama.cpp、vLLM、Ollama、Unsloth Studio 和 Pi 集成的说明。这些集成允许用户在本地或通过兼容的服务器运行模型,并为每个平台提供了详细的特定命令和设置指南。该模型还兼容推理提供商以及 Google Colab 和 Kaggle 等笔记本。

  4. TOOL · CL_99733 ·

    GLM-5.2 模型在 4x RTX 3090 上本地运行速度为 7.3 tok/s

    一位用户详细介绍了在本地运行 GLM-5.2 UD-IQ2_M 模型时的体验,在四块 RTX 3090 GPU 和 192GB RAM 上实现了约 7.3 tokens/秒的吞吐量。他们发现将量化级别从 IQ2 减半到 IQ1 对速度没有影响,而将 CPU 线程从 6 增加到 12 则使性能提升了 22%。用户得出结论,解码速度主要受限于卸载专家(offloaded experts)的 CPU 计算能力,而非内存带宽,并且禁用模型的“…