一项名为 Science Edge Evaluation (SEE) 的新基准已被开发出来,用于评估多模态大语言模型 (MLLMs) 在复杂科学发现任务中的能力。在 19 个 MLLMs 中,达到的最高准确率为 48.7%,通用模型表现优于科学专业模型。即使使用工具,准确率也仅达到 52.7%,这表明当前的 MLLMs 难以在实验证据的界限内管理工具派生信息,并且无法可靠地进行基于证据的推理,而这是真正科学发现的关键步骤。 AI
影响 目前的多模态大语言模型尚不能支持复杂的真实实验室科学或进行基于证据的推理,这表明在人工智能可用于新科学发现之前,仍存在重大差距。
排序理由 该集群描述了一篇介绍用于评估人工智能模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →