研究人员开发了一个名为迭代上下文优化(ICO)的新框架,以增强针对基础模型的语义转移越狱。该方法侧重于优化攻击中使用的上下文信息,因为具有更强语义转移能力的上下文更能有效地引导模型将良性术语重新解释为有害概念。ICO在各种数据集和模型上始终优于现有方法,平均攻击成功率为74.6%。 AI
影响 这项研究突显了基础模型的一个新漏洞以及利用该漏洞的方法,这可能会影响未来的安全研究和模型开发。
排序理由 详细介绍攻击基础模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →