一个名为PaperBenchX的新基准由UniPat AI开发,旨在通过测试AI在不同科学领域复制真实研究论文结果的能力来评估AI的科学可复现性。在测试中,即使是GPT-6 Astra等先进模型,在完全复现论文发现方面也仅达到13.98%的成功率,这凸显了当前AI能力与通用AI科学家要求之间存在的巨大差距。该基准强调通过重新运行模拟来生成可验证的证据,而不仅仅是匹配数值结果,从而解决了对AI生成研究的可靠性和科学有效性的担忧。 AI
影响 凸显了AI在可靠复现科学发现方面的能力差距,表明需要超越解决复杂问题之外的更好评估指标。
排序理由 UniPat AI发布了AI科学可复现性的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →