PulseAugur
中
实时 23:32:09
实体 CritPt

CritPt

PulseAugur coverage of CritPt — every cluster mentioning CritPt across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_236935 ·

    人工智能分析指数 v4.2 发布,Anthropic 领跑排名

    Artificial Analysis 发布了其 Intelligence Index 的 4.2 版本,引入了 AA-Briefcase(用于代理知识工作)和 GDP.pdf(用于长上下文文档推理)等新评估。此次更新将私有、保留测试集的权重增加到 40%,以防止作弊,并包括了更强大的评分基础设施升级。最新排名显示,Anthropic 的 Claude Fable 5.1 领先,其次是 OpenAI 的 GPT-6 Astra 和 Meta。

  2. COMMENTARY · CL_213543 ·

    Reddit讨论显示,AI模型在科学编码基准测试中接近饱和

    Reddit的r/singularity论坛上的一个讨论探讨了AI模型在科学编码基准测试(特别是SciCode、HLE和CritPt)上的饱和点。分析表明,虽然HLE和CritPt的月度改进率分别约为2.6%和2.3%,但SciCode的进展速度明显较慢,约为每月1.2%。讨论强调了即使是GPT 5.6和Claude Fable 5等先进模型在SciCode上的表现似乎也已达到平台期。

  3. RESEARCH · CL_135522 ·

    GPT-5.6 Sol(max) 在物理基准测试中领先,推理设置已详细说明 · 跟踪 3 个来源

    GPT-5.6 Sol(max) 模型在 CritPt 物理问题基准测试中取得了新的领先分数,该基准测试由阿贡国家实验室和伊利诺伊大学厄巴纳-香槟分校开发,属于私有的研究级别评估。该基准测试评估模型解决来自 30 多个机构的 60 多名研究人员提出的研究生级别的物理研究问题,突显了其先进的科学推理能力。此外,关于 GPT-5.6 系列的推理努力设置的细节也已浮出水面,其中 GPT-5.6-Sol 默认设置为“低”级别,而“terra”…