两篇新研究论文探讨了AI安全机制的漏洞。第一篇论文《当安全几何崩溃时》展示了即使是良性的守卫模型,微调也可能无意中破坏其安全对齐,导致完全丧失拒绝能力。第二篇论文《当基于嵌入的防御失效时》揭示了多智能体系统中当前的防御措施可能被攻击者绕过,攻击者可以构造与良性嵌入接近的消息,这表明需要纳入token级别的置信度信号。 AI
影响 强调了AI安全对齐和多智能体系统防御的关键漏洞,需要新的评估和缓解策略。
排序理由 arXiv上发表的两篇学术论文详细介绍了AI安全机制的新漏洞。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →