GLM 5.2 NVFP4
PulseAugur coverage of GLM 5.2 NVFP4 — every cluster mentioning GLM 5.2 NVFP4 across labs, papers, and developer communities, ranked by signal.
-
Kimi K3 和 Inkling 发布,开源模型竞争加剧
人工智能领域竞争激烈,特别是随着 Moonshot AI 的 Kimi K3 发布,这是一款开放权重模型,在编码和智能体任务方面可与前沿闭源模型相媲美。这一发展促使人们重新评估中国和西方人工智能实验室之间的差距,Kimi K3 的表现可能会迫使美国实验室加速推出自己的产品。与此同时,Thinking Machines Lab 推出了 Inkling,这是一款可定制的多模态基础模型,具有开放权重,旨在实现实际应用和定制化,而不仅仅是追求…
-
NVIDIA GLM-5.2-NVFP4 支持在消费级硬件上本地运行AI;Hermes代理指南已更新
NVIDIA的GLM-5.2-NVFP4,一个4位FP4量化模型,支持在消费级硬件上运行大型GLM-5模型,标志着本地AI计算的重大进步,并使开发人员更容易获得先进的文本生成能力。另外,Nous Research更新了其Hermes代理斜杠命令指南,详细介绍了截至2026年4月7日的官方命令,以帮助用户掌握该AI代理的功能。
-
GLM-5.2 NVFP4 修复bug后在128K上下文下达到24 tok/s · 跟踪到1个来源
一位用户解决了在四台DGX Spark上运行GLM-5.2 NVFP4模型时遇到的问题,在128K上下文长度下实现了约每秒24个token的吞吐量。该问题涉及推测解码配置中的一个bug,其中草稿模型的KV缓存和元数据被分片,但其注意力机制未能识别这种分片,导致计算错误。通过确保在配置过程中正确复制`decode_context_parallel_size`,修复了此bug,消除了之前上下文长度和速度之间的权衡。
-
NVIDIA 发布量化版 GLM-5.2 和 MiniMax-M3 模型
NVIDIA 发布了两款新的量化文本生成模型:GLM-5.2-NVFP4 和 MiniMax-M3-NVFP4。GLM-5.2-NVFP4 模型基于 ZAI 的 GLM-5.2,采用 MIT 许可,可用于全球商业和非商业用途。MiniMax-M3-NVFP4 模型支持文本、图像和视频输入,拥有 100 万 token 的上下文窗口,通过 Model Optimizer 使用 NVFP4,但仅限于非商业用途。