作者认为,领先的AI实验室可能将AI安全(AI safety)与AI安保(AI security)混为一谈,从而导致关键漏洞。AI安全侧重于对齐和防止有害输出,依赖于分类器和权重调整等不完美的方法。相比之下,AI安保要求像传统计算机科学标准那样彻底修复漏洞。作者以Anthropic的Boris Cherny关于提示注入“已基本解决”的说法为例,指出基准测试中攻击仍有相当大的成功率,并认为这种方法可能导致了最近的沙盒逃逸事件。 AI
影响 此次讨论突显了AI实验室在处理安保问题时可能存在的根本性缺陷,这可能会影响已部署AI系统的可靠性和安全性。
排序理由 该集群包含一篇评论文章,讨论了AI安全与安保的理念及其潜在影响。
- Advanced Encryption Standard
- AI safety
- AI security
- Anthropic
- Boris Cherny
- prompt injection
- sandbox escapes
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →