一个名为MIRAGE的新基准已被开发出来,用于评估自主网络代理的调查能力。该基准包含750个跨维基百科取证、购物管理和Reddit版主任务的多步决策任务,每个任务都有一个可能具有误导性的可见表面上下文和一个需要主动调查的隐藏上下文。对八个LLM代理的评估显示,尽管代理可以访问相关页面,但它们难以提取决定性证据,在面对矛盾信息时常常失败,并表现出显著的调查性幻觉率。 AI
影响 突出了当前AI代理能力的一个关键差距,表明需要改进证据检索和不确定性下的推理能力。
排序理由 该集群包含一篇介绍用于评估AI代理的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →