PulseAugur
实时 00:45:41
实体 Terminal-Bench-Science 0.1

Terminal-Bench-Science 0.1

PulseAugur coverage of Terminal-Bench-Science 0.1 — every cluster mentioning Terminal-Bench-Science 0.1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. SIGNIFICANT · CL_230971 ·

    Anthropic 发布 Claude Fable 5.1,科学基准测试得分提高

    Anthropic 发布了 Claude Fable 5.1,据称该模型在编码、知识工作和长期问题解决任务方面设定了更高的标准。该模型在新发布的 Terminal-Bench-Science 0.1 基准测试中取得了 52.6% 的分数,相比之前的版本以及 GPT 5.6 "Sol" 等竞争对手有了显著提升。虽然初步测试显示在较低的计算量设置下推理能力有限,但在较高的设置下,输出越来越详细和复杂,其中“最大”计算量设置生成了一个高度详…