PulseAugur
中
实时 09:02:39
实体 Terminal Bench 3.0

Terminal Bench 3.0

PulseAugur coverage of Terminal Bench 3.0 — every cluster mentioning Terminal Bench 3.0 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_239814 ·

    Grok 4.6 基准测试得分因报告方法不同而差异巨大

    xAI 的 Grok 4.6 在同一基准测试中,根据测量方式的不同,表现得分差异巨大。根据 xAI 自家的 Terminal-Bench 3.0 模型卡,该模型得分为 26%,但 Artificial Analysis 的一项独立分析报告称,在基准测试的一个略有不同的版本上得分为 88.4%。这种差异凸显了在报告基准测试结果时限定条件的重要性。

  2. SIGNIFICANT · CL_224062 ·

    Zhipu AI 发布支持 FP8 的 GLM-5.3 MoE 模型

    Zhipu AI 发布了 GLM-5.3,这是一款支持 FP8 精度的混合专家(MoE)文本模型。模型卡中详细介绍了该模型的性能,展示了在 Terminal Bench 3.0(得分 28.3)和 CyberGym(得分 84.5)等基准测试上的表现。GLM-5.3 的许可类别为“其他”。

  3. SIGNIFICANT · CL_207137 ·

    九章智算云聚焦AI基础设施的训练推理一致性

    九章智算云正在开发一个专注于“训练推理一致性”的AI基础设施系统,以支持日益增长的对强化学习(RL)以扩展模型能力的需求。该系统旨在高效管理模型的持续生成、训练和更新,超越简单的“模型+算力”范式。通过集成生成器、环境和训练器等组件,并优化它们之间的动态匹配,九章智算云力求降低成本并提高有效token的产出和模型性能。

  4. SIGNIFICANT · CL_200393 ·

    Zhipu AI 发布 GLM-5.3,在编码和安全基准测试中表现出色

    Zhipu AI 发布了其新模型 GLM-5.3,该模型专为编码和安全任务设计。该模型在基准测试中的性能显著提高,在 SWE-Marathon 上的得分翻了一番多,在 Terminal Bench 3.0 上的得分翻了五倍。GLM-5.3 在 CyberGym 基准测试中也取得了最高分。

  5. FRONTIER RELEASE · CL_200360 ·

    Z.ai 的 GLM-5.3 通过训练后实现编码和网络安全领域的 SOTA

    Z.ai 发布了 GLM-5.3,这是一个更新的模型,通过扩展训练后而非更改其基础模型实现了显著的性能提升。该模型在复杂的编码任务中表现出明显的改进,尤其是在 Terminal-Bench 3.0 等长周期基准测试中,并在网络安全领域展现出新兴能力,在 CyberGym 基准测试中名列前茅。虽然 GLM-5.3 可通过 API 和特定计划获得,但 Z.ai 计划在完成安全评估后约两周内发布模型权重。