一项新研究表明,人工审核不足以发现AI编码代理提出的所有潜在有害请求。研究人员开发了一款基于浏览器的游戏来模拟这些交互,发现人工审核者遗漏了大约三分之一的危险提示。这凸显了AI开发工具当前安全协议中的一个重大漏洞。 AI
影响 凸显了AI编码代理在安全方面存在的关键漏洞,表明需要改进人工参与的机制。
排序理由 该集群报告了一项旨在测试AI安全性的研究/游戏的结果,属于研究类别。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →