PulseAugur
实时 01:37:38
实体 TerminalBench 2.1

TerminalBench 2.1

PulseAugur coverage of TerminalBench 2.1 — every cluster mentioning TerminalBench 2.1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. SIGNIFICANT · CL_145136 ·

    OpenAI 发布 GPT-5.6 Sol,编码和网络安全分数创纪录

    OpenAI 已正式推出其 GPT-5.6 Sol 模型系列,包含三个层级:Sol、Terra 和 Luna。旗舰 Sol 模型在 TerminalBench 2.1 编码基准测试中取得了创纪录的 91.9% 的分数,在网络安全测试中获得 96.7% 的分数,由于其先进的能力,引发了初步的政府审查。在受控预览期后,OpenAI 获得了公开发布的许可,其中包括一个灵活的三层定价结构,旨在满足各种开发人员和企业需求。

  2. FRONTIER RELEASE · CL_130110 ·

    GPT-5.6 在基准测试中挑战 Fable 5,但长任务可靠性存疑 · 追踪 8 个来源

    据报道,OpenAI 已发布 GPT-5.6,将其定位为 Anthropic 的 Claude Fable 5 的竞争对手。虽然 GPT-5.6 Sol 在聚合基准测试中表现强劲且价格显著更低,但 Fable 5 在处理长而复杂的任务和代理工作流方面表现更优。早期报告表明,GPT-5.6 在任务连续性和异常推理模式方面可能存在困难,尽管基准分数具有竞争力,但可能导致输出不准确或无意义。关于 GPT-5.6 的成本效益和速度是否能抵消 …

  3. SIGNIFICANT · CL_112747 ·

    OpenAI 预览 GPT-5.6 系列,Sol Ultra 在 TerminalBench 上超越 Mythos 5

    OpenAI 预览了其新的 GPT-5.6 模型系列,其中包括 Sol Ultra、Sol、Terra 和 Luna。GPT-5.6 Sol Ultra 模型在 TerminalBench 2.1 基准测试中取得了 91.9% 的分数,超过了 Anthropic 的 Claude Mythos 5,后者的得分为 88.0%。Terra 模型提供了与 GPT-5.5 相当的性能,但成本更低,而 Luna 被定位为最具经济效益的选择。新系…