一项对超过4万次游戏运行的分析显示,在玩家作为AI代理的人类监督者时,人类错过了大约三分之一的威胁。该游戏模拟了AI代理请求命令批准的场景,其中很大一部分命令是恶意的。玩家在处理伪装成常规脚本的命令时最为困难,例如`npm run analyze`,尽管执行日志中有明确警告,但这些命令仍被高比例批准。这凸显了人类监督AI代理的潜在漏洞,尤其是在时间压力下,用户可能不会足够仔细地审查命令。 AI
影响 凸显了人类监督AI代理中潜在的安全风险,表明需要改进威胁检测和用户教育。
排序理由 对模拟AI代理命令批准的游戏的分析,提供了人类错误率的统计数据。
在 Hacker News — AI stories ≥50 points 阅读 →
AI 生成摘要 · Google Gemini · 来自 8 个来源。 我们如何撰写摘要 →