实体
SimpleBench
SimpleBench
PulseAugur coverage of SimpleBench — every cluster mentioning SimpleBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 5 条
-
据报道 Grok 4.6 在 SimpleBench 上超越 GPT 5.6 Sol Pro
据报道,Grok 4.6 在 SimpleBench 基准测试中表现优于 GPT 5.6 Sol Pro。此次评估表明领先的 AI 模型之间可能出现性能转变,Grok 在此特定测试中展现出更强的能力。
-
Claude Opus 5 在 SimpleBench 上获得第二名,超越了之前的版本
Claude Opus 5 在 SimpleBench 基准测试中取得了第二高的分数,仅以微弱差距落后于 Fable 5。该基准测试评估模型在时空推理、社交智能以及处理棘手问题的能力。Opus 5 的表现显著优于 Opus 4.6、4.7 和 4.8 等先前版本,以及在此特定评估中测试过的所有其他模型。
-
OpenAI 模型在 SimpleBench 基准测试中表现出显著回归
最近对 OpenAI 模型在 SimpleBench 基准测试上的评估显示出显著回归。这表明在某些任务上的性能可能有所下降,引发了对 OpenAI 模型开发一致性和方向的疑问。
-
Anthropic 的 Claude Fable 5 以 81.9% 的分数在 Simplebench 上名列前茅
Anthropic 的 Claude Fable 5 模型在 Simplebench 基准测试中取得了 81.9% 的分数。这一成绩使其在该评估的排行榜上名列前茅。这一成就凸显了大型语言模型能力的持续进步。
-
新AI模型在SimpleBench上登顶,接近人类表现
一款新AI模型在SimpleBench基准测试中取得了最高分,险些达到人类基线水平。该模型的表现预示着AI能力取得了重大进展,尤其是在模仿人类推理和解决问题的任务上。