一个名为BACKDROP的新基准被引入,用于评估AI代理在动态、真实世界环境中的表现,这与静态基准有显著不同。BACKDROP通过引入四种常见危险:权限、注入、边界和故障来测试代理,以评估当暴露于日常干扰时其性能如何下降。在3,678个变体和16个模型中,当所有危险都存在时,平均通过率从69.5%下降到31.3%,这表明清洁世界性能与真实世界能力之间存在巨大差距。 AI
影响 凸显了AI代理的关键漏洞,表明当前基准高估了真实世界性能,并促使开发更强大的代理。
排序理由 该集群描述了一篇介绍用于评估AI代理的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- BACKDROP
- CatalyzeX
- Claude Fable 5.1
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
- Shubhashis Roy Dipta
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →