一个名为Broken Campus的新基准测试旨在评估AI代理的安全性,该测试揭示了最常见和最令人担忧的失败模式并非完全捏造,而是模型在不知道答案时无法承认。该基准测试在十五个案例中测试了八个模型,发现虽然自信地撒谎很少见,但当正确信息缺失时,模型经常使用真实事实来提供答案。作者认为,像MMLU这样侧重于得出正确答案的传统基准测试,在面对信息缺失时,未能充分衡量代理的安全性,这凸显了模型在面对缺失信息时优雅地拒绝或声明缺乏知识的关键需求。 AI
影响 强调了当前AI代理评估中的一个关键差距,表明在更安全的部署中应优先考虑“拒绝”能力。
排序理由 该项目描述了一个用于评估AI代理安全性的新基准测试,侧重于失败模式而非标准性能指标。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →