一个名为AtomWorld的新基准已被开发出来,用于评估大型语言模型(LLMs)在晶体材料背景下的空间推理能力。该基准在四个建模类别中包含十项基本操作,其中Claude Opus 4.6在测试模型中表现最佳。然而,随着复杂性的增加,成功率显著下降,尤其是在涉及复杂空间关系的操作中,这表明LLMs更适合作为材料结构建模的辅助工具,而不是自主代理。 AI
影响 该基准有望推动更复杂、具有空间意识的AI代理在科学发现和材料设计领域的发展。
排序理由 该集群描述了一个用于评估LLM在特定科学领域能力的新的学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →