GLM-5.2-FP8
PulseAugur coverage of GLM-5.2-FP8 — every cluster mentioning GLM-5.2-FP8 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Moonshot AI的Kimi K3开源模型现已上线Telnyx API
Moonshot AI的Kimi K3是一个拥有2.8万亿参数的开源模型,现已可通过Telnyx推理API访问。该模型拥有100万token的上下文窗口、原生视觉能力和可配置的推理能力。Kimi K3表明,在编码和代理工作流等领域,开源模型正迅速接近Anthropic和OpenAI等竞争对手的闭源前沿模型。
-
GLM-5.2-FP8-DSpark 部署显示性能提升参差不齐
GPUStack 上的一位社区成员部署了 GLM-5.2-FP8-DSpark,这是 GLM-5.2-FP8 的增强版本,它整合了来自 Red Hat AI 的外部草稿模型的推测性解码。性能测试结果喜忧参半:在单并发场景下,DSpark 提升了 2.2 倍;但在高并发情况下,其表现不如原始模型。研究结果表明,DSpark 目前最适合低并发交互式用例,而非高吞吐量的生产工作负载。
-
智谱AI的GLM-5.2模型已部署在无服务器GPU上
智谱AI发布了GLM-5.2,一个拥有7000亿参数的混合专家模型(MoE),在复杂推理和软件工程任务方面表现出色,据报道在某些基准测试中能媲美甚至超越Claude 3.5 Sonnet和GPT-4o等专有模型。由于其庞大的权重和上下文窗口,部署这个大型模型需要一个8x NVIDIA H200 GPU集群,这带来了显著的基础设施挑战。文章详细介绍了在无服务器GPU平台Modal上部署GLM-5.2的案例研究,强调了FP8量化在内存效率…
-
GLM-5.2-FP8 在 HGX-H200 上部署,支持 262k 上下文
一位用户分享了他们使用 SGLang 在 HGX-H200 系统上部署 GLM-5.2-FP8 的 Docker 配置。该配置实现了 262k 的上下文窗口和每秒 70 个 token 的吞吐量。用户指出,为了优化性能,禁用了一些标志,如 DP 和 moe-a2a-backend,并且由于 DSV3 架构上的 FP8 量化,官方 vLLM 配方不适用于 H200。