PulseAugur
中
实时 17:55:38
实体 PaperBenchX

PaperBenchX

PulseAugur coverage of PaperBenchX — every cluster mentioning PaperBenchX across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_287749 ·

    AI模型在科学可复现性方面存在困难,新基准揭示

    一个名为PaperBenchX的新基准由UniPat AI开发,旨在通过测试AI在不同科学领域复制真实研究论文结果的能力来评估AI的科学可复现性。在测试中,即使是GPT-6 Astra等先进模型,在完全复现论文发现方面也仅达到13.98%的成功率,这凸显了当前AI能力与通用AI科学家要求之间存在的巨大差距。该基准强调通过重新运行模拟来生成可验证的证据,而不仅仅是匹配数值结果,从而解决了对AI生成研究的可靠性和科学有效性的担忧。