PulseAugur
实时 07:12:07
实体 SCILAWS-BENCH

SCILAWS-BENCH

PulseAugur coverage of SCILAWS-BENCH — every cluster mentioning SCILAWS-BENCH across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_231331 ·

    新基准SCILAWS-BENCH测试大型语言模型发现科学定律的能力

    研究人员推出了SCILAWS-BENCH,这是一个旨在评估大型语言模型(LLMs)发现科学定律能力的新基准。该基准包含118个问题,源自六个学科的科学论文,使用了大约800万个数据点。它在两种设置下呈现问题:SCILAWS-REAL,评估从固定现实世界观测中发现定律的能力;以及SCILAWS-PARALLEL,涉及模型主动查询合成世界以恢复隐藏定律。研究发现,预测拟合可能与科学有效性不同,模型记忆会影响它们超越现有公式的能力。