PulseAugur
中
实时 00:46:56
实体 SimpleBench

SimpleBench

PulseAugur coverage of SimpleBench — every cluster mentioning SimpleBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. SIGNIFICANT · CL_269597 ·

    Anthropic的Claude Opus 5.5在视觉基准测试中领先;GPT-6系列表现强劲 · 跟踪1个来源

    Anthropic发布了Claude Opus 5.5,该模型在视觉任务上表现出色,并在SimpleBench测试中领先。该新模型在Terminal-Bench-Science基准测试中的推理能力也很强,可与GPT-6 Astra相媲美。与此同时,OpenAI的GPT-6系列,包括Astra、Sol和Luna,在NetHack、Code Arena和DOOM agent任务等领域展现出令人印象深刻的性能。其他值得注意的发布包括具有大上…

  2. MEME · CL_240075 ·

    AI模型在常识基准测试中超越人类,Reddit帖子显示

    一篇Reddit帖子讨论了SimpleBench基准测试,据报道该测试显示,被称为“clankers”的AI模型比人类拥有更多的常识。帖子暗示这预示着人类令人担忧的未来。

  3. TOOL · CL_199468 ·

    据报道 Grok 4.6 在 SimpleBench 上超越 GPT 5.6 Sol Pro

    据报道,Grok 4.6 在 SimpleBench 基准测试中表现优于 GPT 5.6 Sol Pro。此次评估表明领先的 AI 模型之间可能出现性能转变,Grok 在此特定测试中展现出更强的能力。

  4. RESEARCH · CL_162134 ·

    Claude Opus 5 在 SimpleBench 上获得第二名,超越了之前的版本

    Claude Opus 5 在 SimpleBench 基准测试中取得了第二高的分数,仅以微弱差距落后于 Fable 5。该基准测试评估模型在时空推理、社交智能以及处理棘手问题的能力。Opus 5 的表现显著优于 Opus 4.6、4.7 和 4.8 等先前版本,以及在此特定评估中测试过的所有其他模型。

  5. TOOL · CL_137009 ·

    OpenAI 模型在 SimpleBench 基准测试中表现出显著回归

    最近对 OpenAI 模型在 SimpleBench 基准测试上的评估显示出显著回归。这表明在某些任务上的性能可能有所下降,引发了对 OpenAI 模型开发一致性和方向的疑问。

  6. TOOL · CL_83524 ·

    Anthropic 的 Claude Fable 5 以 81.9% 的分数在 Simplebench 上名列前茅

    Anthropic 的 Claude Fable 5 模型在 Simplebench 基准测试中取得了 81.9% 的分数。这一成绩使其在该评估的排行榜上名列前茅。这一成就凸显了大型语言模型能力的持续进步。

  7. TOOL · CL_83407 ·

    新AI模型在SimpleBench上登顶,接近人类表现

    一款新AI模型在SimpleBench基准测试中取得了最高分,险些达到人类基线水平。该模型的表现预示着AI能力取得了重大进展,尤其是在模仿人类推理和解决问题的任务上。