PulseAugur
实时 09:26:03
English(EN) Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

新基准揭示多模态大语言模型在科学发现方面存在困难

一项名为 Science Edge Evaluation (SEE) 的新基准已被开发出来,用于评估多模态大语言模型 (MLLMs) 在复杂科学发现任务中的能力。在 19 个 MLLMs 中,达到的最高准确率为 48.7%,通用模型表现优于科学专业模型。即使使用工具,准确率也仅达到 52.7%,这表明当前的 MLLMs 难以在实验证据的界限内管理工具派生信息,并且无法可靠地进行基于证据的推理,而这是真正科学发现的关键步骤。 AI

影响 目前的多模态大语言模型尚不能支持复杂的真实实验室科学或进行基于证据的推理,这表明在人工智能可用于新科学发现之前,仍存在重大差距。

排序理由 该集群描述了一篇介绍用于评估人工智能模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示多模态大语言模型在科学发现方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang,… ·

    Science Edge 评估:SEE 迈向真正科学发现的缺失一步

    arXiv:2608.06931v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly involved in scientific discovery, yet it remains unclear whether they can support complex real laboratory science. Here we introduce Science Edge Evaluation (SEE), a multimodal benchmark…