引入了一个名为 WANDR 的新基准测试,用于评估研究代理在宽泛且深入的数据收集任务中的能力。WANDR 包含 500 个现实场景,要求代理发现广泛的实体集,为每个实体进行深入的网络搜索,并汇编带有支持证据的可验证记录。该基准测试使用动态的、特定任务的裁判,它们会重新抓取网页以确保准确性,并允许评估当前信息,超越了静态答案集。对六个生产研究系统的初步评估显示,即使是最强的系统,软 F1 分数也仅为 0.363,表明在处理增加的数据量和层次复杂性方面仍有很大的改进空间。 AI
影响 该基准测试有望推动 AI 代理执行复杂、多步骤研究任务的能力的进步,可能影响需要广泛数据综合的领域。
排序理由 该集群描述了一个用于评估 AI 代理的新学术基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →