PulseAugur
实时 05:44:56
实体 GLM~5.1

GLM~5.1

PulseAugur coverage of GLM~5.1 — every cluster mentioning GLM~5.1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 83
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 14
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-15 product_launch Together AI has launched GLM 5.1, an open-source inference model. 来源
  2. 2026-06-09 research_milestone GLM-5.1 achieved a leading score on the SWE-Bench Pro benchmark, surpassing proprietary models. 来源
  3. 2026-05-11 product_launch Zai.org open-sourced its GLM-5.1 large language model. 来源
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/5 页 · 共 83 条
  1. TOOL · CL_201630 ·

    AI CTF锦标赛结果挑战模型规模假设

    一场AI夺旗赛(CTF)最初表明,在安全推理和多步利用方面,更大的模型更具优势。然而,随后涉及更大模型和不同提示词的更广泛比赛却与这些初步发现相矛盾。比赛揭示,模型规模并非成功的唯一决定因素,即使是较小的模型也能进行多步利用,而较大的模型有时却在基本的定位和枚举方面遇到困难。

  2. TOOL · CL_180282 ·

    CI检查管理中文大语言模型名称和Token预算

    一位开发者创建了一个CI检查,用于管理快速变化的中文大语言模型名称及其相关的Token预算。该工具通过将模型目录视为可固定和检查的部署时依赖项,帮助确保生产稳定性。演示 walkthrough 展示了如何使用AIWave定价页面构建一个清单检查,该页面作为各种中文AI模型的入口,根据提供的比例计算美元价格。

  3. TOOL · CL_173740 ·

    PIVOT 方法通过优化稀疏注意力来加速长上下文 AI 模型

    一种名为 PIVOT 的新方法已被开发出来,用于优化动态稀疏注意力 (DSA) 模型在处理长上下文时的性能。PIVOT 解决了 DSA 索引器中的瓶颈问题,该瓶颈之前导致了二次方复杂度和推理速度减慢。通过对查询进行分组并为每个组使用单个代理扫描,PIVOT 显著加快了索引器的速度并降低了整体延迟,而无需重新训练模型。这种方法在 DeepSeek V3.2 和 GLM-5.1 等模型上展示了 4 倍的索引器加速和 1.6 倍的延迟降低。

  4. RESEARCH · CL_171855 ·

    MindForge 管道训练小型 LLM 完成软件工程全生命周期

    研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…

  5. TOOL · CL_167561 ·

    PIVOT索引方法加速LLM中的稀疏注意力

    研究人员开发了PIVOT,一种新颖的索引方法,旨在优化大型语言模型中的令牌级稀疏注意力。PIVOT通过减少冗余计算,解决了DeepSeek Sparse Attention等系统中索引器造成的瓶颈。它通过对附近的查询进行分组并执行一次共享扫描来识别候选令牌,从而显著加速了索引过程。

  6. SIGNIFICANT · CL_162724 ·

    智谱 AI 的 GLM-5.2 以 100 万上下文窗口引领开放权重模型 · 跟踪 1 个来源

    来自中国智谱 AI 的新型开放权重模型 GLM-5.2 已被评为截至 2026 年 7 月表现最佳的开放模型。在 Artificial Analysis 的 Intelligence Index v4.1 中,它获得了 51 分,在所有模型中排名第四,在公开可用权重的模型中排名第一。该模型拥有百万级上下文窗口,在编码任务方面表现出色,在 SWE-bench Pro 等基准测试中超越了 GPT-5.5 等竞争对手。

  7. RESEARCH · CL_161409 ·

    LLM基准测试结果揭示多个模型的性能 · 追踪9个来源

    一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…

  8. RESEARCH · CL_160674 ·

    新的红队测试协议发现大语言模型生成代码中的隐藏错误

    研究人员开发了一种名为 Code Monitor Red Teaming 的新协议,用于识别已通过公开测试的大语言模型生成代码中的隐藏错误。该研究使用了包含超过 71,000 个代码候选的 CodeMonitorBench 基准,发现即使通过了可见测试,仍有相当一部分代码包含残余错误。较弱的大语言模型验证器在脚手架和模型家族方面有所改进,但通常无法在 5% 的误报率下检测到大多数隐藏错误。GLM-5.1 验证器显示出一定的恢复能力,但…

  9. TOOL · CL_146482 ·

    Anomaly 推出每月 10 美元的 OpenCode Go,提供精选的 AI 编码模型

    Anomaly 推出了 OpenCode Go,一项每月 10 美元的订阅服务,提供对 13 个开源 AI 编码模型的精选库的访问。该服务旨在为开发人员提供一种可靠且经济实惠的方式来使用这些模型,而无需管理多个 API 密钥或提供商。OpenCode Go 与现有的 OpenCode AI 编码代理无缝集成,也可以通过与 OpenAI 兼容的端点与其他工具一起使用。该套餐包含慷慨的使用限制,并优先考虑经过编码工作流程测试的模型,选项范…

  10. SIGNIFICANT · CL_138902 ·

    腾讯 Hy3 开源 MoE 模型在盲测中击败 GLM-5.1

    腾讯发布了 Hy3,一个拥有 210 亿激活参数的开源混合专家(MoE)模型,在盲测中表现优于智谱的 GLM-5.1。该模型拥有 2950 亿总参数和 256K 上下文窗口,根据 Apache 2.0 许可协议发布。Hy3 可通过 OpenRouter 和腾讯云访问,并提供免费推理的促销期至 2026 年 7 月 21 日。

  11. SIGNIFICANT · CL_134311 ·

    Tencent 发布 Hy3 模型,拥有 2950 亿参数和 256K 上下文

    Tencent 发布了 Hy3,一个开放权重的人工智能模型,拥有 2950 亿参数,具备 210 亿活跃参数推理和 38 亿参数预测头。该模型拥有 256K 上下文窗口,并采用 top-8 路由和 192 个专家。Hy3 以 Apache 2.0 许可发布,可在 OpenRouter 上使用,每百万输入 tokens 约 6 美分,并有涵盖入驻成本的介绍性优惠。

  12. COMMENTARY · CL_133931 ·

    开放权重的大语言模型(LLM)可免费访问但运行成本高昂,给开发者带来挑战

    文章认为,虽然开放权重的LLM在技术上可以免费访问,但其巨大的规模常常使其在标准硬件上运行成本过高且难以实现。Qwen、DeepSeek、GLM、Kimi和MiniMax等模型被列为这一趋势的例子,参数数量达到数百亿甚至数万亿。作者认为,焦点应从原始参数数量和开放权重转移到实际部署成本和效率上,将效率定义为能力与运营成本的最佳比率。对开发者而言,这意味着在本地推理时优先选择更小、更易于管理模型,并在为产品选择模型时,将活跃参数和实际延…

  13. TOOL · CL_130238 ·

    腾讯Hy3模型在真实世界任务中表现强劲

    Hy3基准测试结果显示,该模型在性能上可与DeepSeek v4和GLM-5.1等其他先进模型相媲美。腾讯Hy3在312个真实世界工作流任务上取得了2.67/4的得分,优于GLM-5.1的2.51/4得分,在前端开发、CI/CD以及数据/存储任务方面有显著改进。尽管这些结果令人鼓舞,但仍需要进一步的独立测试来验证其在实际应用中的收益。

  14. SIGNIFICANT · CL_129683 ·

    Tencent 发布 Hy3,一个开放的 295B MoE 模型,支持 256K 上下文

    Tencent 发布了 Hy3,一个开源的 2950 亿参数专家混合(MoE)模型,专为复杂推理、代理工作流和长上下文任务而设计。该模型每个 token 只激活 210 亿参数,在保持效率的同时支持 256K 的上下文窗口。Hy3 在编码、STEM 和推理任务等各种基准测试中表现出色,并经过特定训练以提高工具调用中的可靠性、减少幻觉并增强多轮意图跟踪。该模型可通过兼容 OpenAI 的 API 访问,并提供 `reasoning_ef…

  15. TOOL · CL_126972 ·

    AI效率促使中国大型科技公司裁员

    裁员潮正席卷中国各大科技公司,AI效率提升被列为主要原因。初级工程师和高绩效员工均被裁,公司寻求精简运营和降低成本。这一趋势与硅谷的类似举动相呼应,反映了行业向AI整合的更广泛转变,导致员工工作强度增加和焦虑感加剧。

  16. TOOL · CL_124127 ·

    11个LLM在代码重构和提案评估方面的评估

    一项实验评估了十一个大型语言模型重构LangGraph代理中复杂“神节点”的能力。模型被要求提出解决方案来梳理该节点的逻辑,然后互相评估彼此的提案。作者采用了三种不同的方法来确定哪些模型作为代码生成器和评估者最值得信赖。

  17. TOOL · CL_122978 ·

    Mastermind框架提升AI代理漏洞复现成功率

    研究人员开发了一个名为Mastermind的新框架,以提高AI代理在复杂软件工程任务(特别是漏洞复现)中的性能。该框架将可迁移策略的学习与特定任务的执行分离开来,允许一个可训练的规划器通过监督微调和强化学习来优化可重用策略。在测试GPT-5.5、GPT-5.4和GLM-5.1等模型时,Mastermind显著提高了它们识别和复现软件漏洞的成功率。

  18. TOOL · CL_129594 ·

    Mastermind框架提升了AI代理的漏洞复现能力

    一种名为Mastermind的新型双循环框架已被引入,以增强软件工程代理复现仓库规模漏洞的能力。该框架将策略学习与特定任务的经验分离开来,允许一个可训练的规划器学习可重用的策略,从而改进多个冻结的执行器。在CyberGym上的评估表明,Mastermind与GPT-5.5结合使用时,通过率达到了84.5%,显著优于其他方法。

  19. SIGNIFICANT · CL_119866 ·

    中国GLM-5.2开源模型挑战顶级闭源AI · 跟踪1个来源

    中国人工智能实验室智谱AI发布了GLM-5.2,这是一款开放权重模型,在性能上可与Claude Opus和GPT-5.5等顶级闭源模型相媲美,尤其是在编码和长上下文任务方面。GLM-5.2支持100万token的上下文窗口,使其能够处理复杂的、多文件的软件工程项目和广泛的数据分析。它的发布被视为开源模型的一个重要进步,为开发人员提供了一个比专有系统更可控、潜在更易于访问的替代方案,尤其是在对闭源API可靠性担忧的背景下。

  20. TOOL · CL_119867 ·

    国内AI模型代码能力测试:MiniMax和Kimi领先

    对五款国内AI模型——MiniMax M3、Kimi K2.6、DeepSeek V4 Pro、Qwen 3.7 Max和GLM 5.1——在真实工程任务上的对比分析,揭示了它们在代码能力方面的显著差异。MiniMax M3和Kimi K2.6并列第一,其中MiniMax在系统稳定性和可用性方面表现突出,Kimi则在可维护性和文档方面获得好评。DeepSeek V4 Pro展示了强大的架构设计,但在代码正确性方面有所欠缺;Qwen 3…