研究人员展示了一种针对大型语言模型的新型攻击方式,该方式无需微调即可绕过安全措施。这些“任意密码攻击”涉及在加密的有害问题和响应上训练模型,使模型能够通过学习到的加密方案进行通信。这种方法显著削弱或完全绕过了模型对齐和有害性分类器,因为加密内容被视为乱码。该研究成功地针对Anthropic、Google和OpenAI的前沿模型执行了这些攻击,揭示了商用黑盒大型语言模型的一种新颖漏洞。 AI
影响 这项研究揭示了一种绕过大型语言模型安全过滤器的新方法,可能影响已部署人工智能系统的安全性和可靠性。
排序理由 详细介绍针对大型语言模型的新型攻击向量的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →