zai-org/GLM-5.2-FP8
PulseAugur coverage of zai-org/GLM-5.2-FP8 — every cluster mentioning zai-org/GLM-5.2-FP8 across labs, papers, and developer communities, ranked by signal.
-
GLM-5.2 模型通过 colibri 引擎更新以实现更快的推理速度
Hugging Face 上发布了 GLM-5.2 模型的新版本,名为“colibri int4 with int8 mtp”。此版本基于原始 GLM-5.2 模型,并采用了 int8 MTP 头部,旨在通过推测性解码显著提高推理速度。该模型需要 colibri 引擎才能运行,并且与 GGUF 或 AWQ 等标准格式不兼容。它在 MIT 许可下分发。
-
GLM-5.2 模型通过 Colibri 引擎实现量化,可在消费级硬件上运行
GLM-5.2 模型的一个量化版本,名为 jlnsrk/GLM-5.2-colibri-int4,已在 Hugging Face 上发布。该版本通过从磁盘流式传输专家,旨在在消费级硬件上运行,需要大约 25 GB 的 RAM 和 400 GB 的快速本地存储。该模型使用自定义容器格式,仅与 Colibri 引擎兼容,不支持 GGUF 或 GPTQ 等标准格式。
-
GLM-5.2 模型速度通过自定义优化提升超过 20 倍
一位 Reddit 用户详细介绍了一种在专用 GH200 系统上显著加速 GLM-5.2 大型语言模型的方法。通过组合不同存储库的组件并修补 vLLM 推理引擎,该用户实现了超过每秒 50 个 token 的推理速度,相比模型初始性能有了显著提升。该过程涉及将 zai-org/GLM-5.2-FP8 存储库的权重与 cyankiwi/GLM-5.2-AWQ-INT4 的 AWQ 量化版本合并。
-
Z.ai 发布 GLM-5.2,支持百万级上下文并采用开源许可
Z.ai 发布了 GLM-5.2,这是一款专为长时任务设计的新旗舰模型,拥有百万级 token 的上下文窗口。该模型通过可调节的努力级别提高了编码能力,并采用名为 IndexShare 的增强架构,降低了长上下文的计算成本。GLM-5.2 以 MIT 开源许可发布,允许全球无限制的访问和技术使用。