Perplexity 推出了 WANDR,一个旨在评估研究代理的新开放基准。该基准包含 500 个任务,要求代理查找和引用证据来支持其发现。在初步测试中,Perplexity Search as Code 以 0.363 的软 F1 分数获得最高分。 AI
影响 该基准可以加速能够进行复杂信息检索和基于证据推理的 AI 代理的开发和评估。
排序理由 该集群描述了一个用于评估 AI 研究代理的新基准的发布。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →