研究人员推出了HopRefusalBench,这是一个新的基准,旨在评估增强搜索的大型语言模型Agent在多步推理场景中处理无法回答问题的能力。该基准包含889个由实体路径构建的问题,涵盖了三种无法回答的原因和三种推理拓扑。在测试的十个专有和开源模型中,表现最好的模型仅实现了42.9%的正确停止率,这表明在适当时候可靠地拒绝回答方面存在重大挑战。 AI
影响 凸显了当前AI Agent在可靠拒绝无法回答的查询方面存在的关键局限性,影响了它们在复杂推理任务中的可信度。
排序理由 该集群包含一篇介绍新AI模型能力评估基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →