一项名为EarthVerse的新基准测试已被推出,用于评估科学代理在分析动态地球系统和自然灾害方面的能力。该基准测试包含405个基于已记录事件和灾害类别的可复现任务,旨在测试代理在检查数据、选择证据、执行计算和维护出处方面的能力。对25个模型和代理系统的初步评估显示,在端到端的科学可靠性方面存在显著差距,目前的代理在科学研究的各个方面经常难以维持一致的推理链。 AI
影响 该基准测试旨在提高AI代理在复杂地球系统分析中可靠性和端到端科学推理能力。
排序理由 该集群包含一篇介绍AI代理新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →