PulseAugur
中
实时 12:00:40
实体 Nonobench

Nonobench

PulseAugur coverage of Nonobench — every cluster mentioning Nonobench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_278824 ·

    Nonobench基准测试在数图谜题上评估49个大型语言模型

    一个名为Nonobench的新开源基准测试已发布,用于评估49个大型语言模型在数图谜题上的性能。该基准测试包括不同大小的标准谜题和旨在测试超越简单模式识别的逻辑的更具挑战性的随机谜题。结果显示,随着谜题复杂度的增加,解题率显著下降,GPT-6 Astra是唯一能够解决所有标准谜题的模型,而Claude Opus 5.5在更难的谜题上表现最佳。