研究人员推出了DRBENCHER,这是一个旨在评估AI代理结合网络浏览和多步数学计算能力的基准。与以往单独评估这些技能的基准不同,DRBENCHER从知识图中综合问题,要求代理识别实体、检索属性并执行特定领域的计算。该基准涵盖五个领域:生物化学、金融、地球物理学、安全和历史。人工评估显示有效率为76%,其中相当一部分错误归因于过时的知识图数据,而即使是先进的前沿模型在该基准上的准确率也仅为20%。 AI
影响 该基准突显了当前AI代理在整合浏览和复杂计算方面的局限性,可能指导未来研究朝着更强大、更稳健的系统发展。
排序理由 该集群描述了一个用于评估AI代理的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- bank
- biochemistry
- BrowseComp+
- DRBENCHER
- Geophysical Research Letters
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- History++
- knowledge graph
- Math-500
- Security
- Young Suk Lee
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →