研究人员开发了DiscoverPhysics,这是一个旨在测试大型语言模型(LLM)科学推理能力的新基准。这个交互式基准挑战LLM代理在具有新颖物理学的模拟世界中发现运动定律,要求它们设计实验、观察数据,并提出自然语言解释和推断定律的Python实现。对十一个前沿模型的评估显示,即使是最强的代理也只能通过一半的世界,尤其是在揭示潜在结构方面遇到困难。该基准还突显了开源模型和商业模型之间存在的显著差距,后者在实验设计和数据提取能力方面表现更优。 AI
影响 该基准有望推动具有更强大科学推理和假设生成能力的大型语言模型的发展。
排序理由 该集群描述了一篇介绍用于评估大型语言模型能力的新颖基准的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →