研究人员推出了SCILAWS-BENCH,这是一个旨在评估大型语言模型(LLMs)发现科学定律能力的新基准。该基准包含118个问题,源自六个学科的科学论文,使用了大约800万个数据点。它在两种设置下呈现问题:SCILAWS-REAL,评估从固定现实世界观测中发现定律的能力;以及SCILAWS-PARALLEL,涉及模型主动查询合成世界以恢复隐藏定律。研究发现,预测拟合可能与科学有效性不同,模型记忆会影响它们超越现有公式的能力。 AI
影响 该基准旨在提供对人工智能科学发现能力更稳健的评估,超越合成或熟悉的问题。
排序理由 该集群包含一篇介绍用于评估人工智能能力的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →