研究人员推出了 CausalGame,这是一个旨在评估大型语言模型 (LLM) 智能体因果思维能力的新基准。该基准通过纳入选择偏差、测量误差和隐藏混淆因素等现实世界挑战,解决了现有 AI 科学家评估的局限性。CausalGame 要求 LLM 智能体在 14 个不同的场景中主动设计实验、收集数据并报告结果。对 30 个 LLM 智能体的初步测试显示,没有一个表现出可靠的因果推理能力,表现最好的模型得分远低于分析最优值。 AI
影响 该基准可以加速开发更强大的、能够进行真正因果推理的 AI 科学家,这对于科学发现至关重要。
排序理由 该集群描述了一篇介绍用于评估 AI 能力的基准的新学术论文。
- arXiv
- CausalGame
- large-language models
- LLM agents
- AI Scientist: The Next Generation Scientific Research Paradigm Driven by Scientific and Technological Information
- hidden confounders
- measurement error
- selection bias
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →