PulseAugur
实时 10:23:36
实体 Science Edge Evaluation

Science Edge Evaluation

PulseAugur coverage of Science Edge Evaluation — every cluster mentioning Science Edge Evaluation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_191126 ·

    新基准揭示多模态大语言模型在科学发现方面存在困难

    一项名为 Science Edge Evaluation (SEE) 的新基准已被开发出来,用于评估多模态大语言模型 (MLLMs) 在复杂科学发现任务中的能力。在 19 个 MLLMs 中,达到的最高准确率为 48.7%,通用模型表现优于科学专业模型。即使使用工具,准确率也仅达到 52.7%,这表明当前的 MLLMs 难以在实验证据的界限内管理工具派生信息,并且无法可靠地进行基于证据的推理,而这是真正科学发现的关键步骤。