开发了两个新基准 PHD 和 SDABench,用于评估大型语言模型 (LLM) 在科学发现和数据分析方面的能力。PHD 侧重于模型从不确凿证据中自主构建假设空间的能力,而 SDABench 则评估了包括探索、推理和跨不同科学领域的机械推理在内的六项特定科学能力。对 15 个大型语言模型的初步评估表明,虽然模型在描述性任务方面表现出色,但在更复杂的推理、假设选择和机械解释方面存在困难,这表明它们在科学发现潜力方面存在显著差距。 AI
影响 突出了当前大型语言模型在复杂科学推理方面的局限性,指出了未来模型开发的方向。
排序理由 该集群描述了用于评估大型语言模型在科学发现和数据分析方面的新学术基准。
- biology
- Chemistry
- environment
- geography
- physics
- SDABench
- SDA-Real
- SDA-Synth
- PHD
- HypoArena
- HypoData
- HypoEval
- LLMs
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →