GLM~5.1
PulseAugur coverage of GLM~5.1 — every cluster mentioning GLM~5.1 across labs, papers, and developer communities, ranked by signal.
- developed by Zhipu AI 95%
- instance of Zhipu AI 95%
- instance of GLM-5.2 90%
- developed GLM-5.2 90%
- competes with tencent/Hy3 90%
- uses Fireworks AI 90%
- competes with Claude Opus 4-8 80%
- competes with Tencent 80%
- affiliated with Zhipu AI 70%
- competes with GLM-5.2 70%
- competes with Zhipu AI 70%
- used by DeepSeek V4-Pro 70%
- 2026-06-15 product_launch Together AI has launched GLM 5.1, an open-source inference model. 来源
- 2026-06-09 research_milestone GLM-5.1 achieved a leading score on the SWE-Bench Pro benchmark, surpassing proprietary models. 来源
- 2026-05-11 product_launch Zai.org open-sourced its GLM-5.1 large language model. 来源
3 天有情绪数据
-
量化对大型语言模型的影响:解释质量与压缩
dev.to 上最近的一篇讨论探讨了量化对大型语言模型的影响,特别是在 OpenCode Go 订阅服务的背景下。量化压缩模型权重以降低内存和计算需求,但其有效性因使用的方法和比特深度而异。虽然 Q8_0 和 Q5_K_M 等较高比特深度几乎保留了原始模型的所有质量,但 Q4_K_M,尤其是 Q2_K 等较低比特深度可能导致性能明显下降,这可能解释了用户对使用经过大量量化模型的服务的抱怨。
-
7名博士生利用数百个AI代理从零开始训练7B大语言模型
北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。
-
开源ZGCM-1模型在数学和智能体搜索方面实现高效率
研究人员推出ZGCM-1,一个为数学推理和智能体搜索设计的7B参数基础模型。该模型利用了一种高效的训练方法,结合了交错注意力等架构创新、稳定的FP8 Muon优化器以及渐进式课程学习。ZGCM-1在特定任务上展现出与更大规模前沿模型相媲美的性能,并在训练时间上提供了显著的效率提升。
-
Together AI 扩展微调服务,新增模型和实时跟踪
Together AI 通过整合更多开源模型,包括 GLM 5.3 和 Kimi K2.7 等高级选项,以及 Qwen 3.8-27B 和 Gemma 4 等经济高效的选择,增强了其微调服务。此次更新还引入了实时实验跟踪,允许用户通过仪表板或 API 实时监控训练进度和指标。此外,该服务现在提供对微调过程更精细的控制,包括专家 LoRA 功能,能够训练模型的核心知识层,从而提高在需要新信息的任务上的性能。
-
开源AI模型在网络安全任务中表现优于前沿模型
一项最近对各种AI模型在网络安全任务中的比较分析发现,开源模型在识别安全漏洞方面显著优于前沿模型。在27个代码库和超过1600次模型运行中,DeepSeek-V4-Flash和GLM-5.1等模型在检测实际安全问题方面表现出卓越的性能,而像Claude Opus 5这样先进的模型甚至未能识别出其测试样本中的任何漏洞。这表明,对于网络安全等本地化、专业化应用,开源AI解决方案目前更有效。
-
作者添加DeepSeek V4-Pro以应对独特的AI故障模式
作者详细介绍了选择一个额外的AI模型来补充现有订阅的研究过程,强调需要那些表现出不同故障模式的模型。在评估了多个选项后,DeepSeek V4-Pro被确定为首选,因为它拥有独特的训练生态系统,有望提供独特的见解。作者计划用少量预算测试该模型,重点关注其发现其他模型遗漏问题的能力,而不是仅仅增加输出量。
-
GLM-5.1 (非推理) 在 GPQA 基准测试中达到 83.9%
一项新的基准评估显示,GLM-5.1 (非推理) 在 GPQA 基准测试中取得了 83.9% 的分数。此性能由独立机构测量,突显了该模型的效率,每花费一美元可提供 13.3 个智能点数。
-
AI执行成本骤降,价值转向想象力和新颖的问题解决
随着AI模型能力增强和执行成本降低,软件开发中有价值工作的性质正在发生转变。虽然常规任务可以由更便宜的模型高效处理,但最有影响力的工作现在涉及不适合传统待办事项列表的新颖问题。一项实验表明,虽然多个AI模型在标准任务上的表现相似,但一个前沿模型在一个复杂的优化问题上取得了显著的性能提升,尽管成本更高。这凸显了组织面临的新限制:不是成本或能力,而是工程师利用先进AI探索未知问题的想象力和自由度。
-
AI CTF锦标赛结果挑战模型规模假设
一场AI夺旗赛(CTF)最初表明,在安全推理和多步利用方面,更大的模型更具优势。然而,随后涉及更大模型和不同提示词的更广泛比赛却与这些初步发现相矛盾。比赛揭示,模型规模并非成功的唯一决定因素,即使是较小的模型也能进行多步利用,而较大的模型有时却在基本的定位和枚举方面遇到困难。
-
CI检查管理中文大语言模型名称和Token预算
一位开发者创建了一个CI检查,用于管理快速变化的中文大语言模型名称及其相关的Token预算。该工具通过将模型目录视为可固定和检查的部署时依赖项,帮助确保生产稳定性。演示 walkthrough 展示了如何使用AIWave定价页面构建一个清单检查,该页面作为各种中文AI模型的入口,根据提供的比例计算美元价格。
-
PIVOT 方法通过优化稀疏注意力来加速长上下文 AI 模型
一种名为 PIVOT 的新方法已被开发出来,用于优化动态稀疏注意力 (DSA) 模型在处理长上下文时的性能。PIVOT 解决了 DSA 索引器中的瓶颈问题,该瓶颈之前导致了二次方复杂度和推理速度减慢。通过对查询进行分组并为每个组使用单个代理扫描,PIVOT 显著加快了索引器的速度并降低了整体延迟,而无需重新训练模型。这种方法在 DeepSeek V3.2 和 GLM-5.1 等模型上展示了 4 倍的索引器加速和 1.6 倍的延迟降低。
-
MindForge 管道训练小型 LLM 完成软件工程全生命周期
研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…
-
PIVOT索引方法加速LLM中的稀疏注意力
研究人员开发了PIVOT,一种新颖的索引方法,旨在优化大型语言模型中的令牌级稀疏注意力。PIVOT通过减少冗余计算,解决了DeepSeek Sparse Attention等系统中索引器造成的瓶颈。它通过对附近的查询进行分组并执行一次共享扫描来识别候选令牌,从而显著加速了索引过程。
-
智谱 AI 的 GLM-5.2 以 100 万上下文窗口引领开放权重模型 · 跟踪 1 个来源
来自中国智谱 AI 的新型开放权重模型 GLM-5.2 已被评为截至 2026 年 7 月表现最佳的开放模型。在 Artificial Analysis 的 Intelligence Index v4.1 中,它获得了 51 分,在所有模型中排名第四,在公开可用权重的模型中排名第一。该模型拥有百万级上下文窗口,在编码任务方面表现出色,在 SWE-bench Pro 等基准测试中超越了 GPT-5.5 等竞争对手。
-
LLM基准测试结果揭示多个模型的性能 · 追踪9个来源
一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…
-
新的红队测试协议发现大语言模型生成代码中的隐藏错误
研究人员开发了一种名为 Code Monitor Red Teaming 的新协议,用于识别已通过公开测试的大语言模型生成代码中的隐藏错误。该研究使用了包含超过 71,000 个代码候选的 CodeMonitorBench 基准,发现即使通过了可见测试,仍有相当一部分代码包含残余错误。较弱的大语言模型验证器在脚手架和模型家族方面有所改进,但通常无法在 5% 的误报率下检测到大多数隐藏错误。GLM-5.1 验证器显示出一定的恢复能力,但…
-
Anomaly 推出每月 10 美元的 OpenCode Go,提供精选的 AI 编码模型
Anomaly 推出了 OpenCode Go,一项每月 10 美元的订阅服务,提供对 13 个开源 AI 编码模型的精选库的访问。该服务旨在为开发人员提供一种可靠且经济实惠的方式来使用这些模型,而无需管理多个 API 密钥或提供商。OpenCode Go 与现有的 OpenCode AI 编码代理无缝集成,也可以通过与 OpenAI 兼容的端点与其他工具一起使用。该套餐包含慷慨的使用限制,并优先考虑经过编码工作流程测试的模型,选项范…
-
腾讯 Hy3 开源 MoE 模型在盲测中击败 GLM-5.1
腾讯发布了 Hy3,一个拥有 210 亿激活参数的开源混合专家(MoE)模型,在盲测中表现优于智谱的 GLM-5.1。该模型拥有 2950 亿总参数和 256K 上下文窗口,根据 Apache 2.0 许可协议发布。Hy3 可通过 OpenRouter 和腾讯云访问,并提供免费推理的促销期至 2026 年 7 月 21 日。
-
Tencent 发布 Hy3 模型,拥有 2950 亿参数和 256K 上下文
Tencent 发布了 Hy3,一个开放权重的人工智能模型,拥有 2950 亿参数,具备 210 亿活跃参数推理和 38 亿参数预测头。该模型拥有 256K 上下文窗口,并采用 top-8 路由和 192 个专家。Hy3 以 Apache 2.0 许可发布,可在 OpenRouter 上使用,每百万输入 tokens 约 6 美分,并有涵盖入驻成本的介绍性优惠。
-
开放权重的大语言模型(LLM)可免费访问但运行成本高昂,给开发者带来挑战
文章认为,虽然开放权重的LLM在技术上可以免费访问,但其巨大的规模常常使其在标准硬件上运行成本过高且难以实现。Qwen、DeepSeek、GLM、Kimi和MiniMax等模型被列为这一趋势的例子,参数数量达到数百亿甚至数万亿。作者认为,焦点应从原始参数数量和开放权重转移到实际部署成本和效率上,将效率定义为能力与运营成本的最佳比率。对开发者而言,这意味着在本地推理时优先选择更小、更易于管理模型,并在为产品选择模型时,将活跃参数和实际延…