引入了一个名为FrontierChallenge的新基准,用于评估AI模型端到端完成科学工作流的能力。该基准包含跨越量子化学、分子动力学和生物学等不同科学领域的300个任务。对使用三种代理框架的十二个前沿模型的初步评估表明,即使是表现最佳的配置,也只能完全完成约20%的已发布任务,这表明在部分进展和完整的科学交付之间存在显著差距。 AI
影响 强调了在复杂科学领域需要更好的AI代理评估指标,推动更强大的端到端工作流完成能力。
排序理由 该集群包含一篇介绍用于评估AI模型在科学任务上表现的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →