研究人员开发了一个名为多轮认证鲁棒性 (MTCR) 的新框架,以解决大型语言模型 (LLM) 易受多轮越狱攻击的漏洞。现有方法难以应对顺序攻击,导致安全边界呈指数级下降。MTCR 使用状态对抗 MDP 对话安全进行建模,并通过嵌入空间模式分解引入组合认证以获得更紧密的边界。它还纳入了安全持久性,提高了下降率并提供了可解释的范围估计,实验表明经验安全性超过了认证边界。 AI
影响 这项研究可能带来更安全的 LLM,通过防御复杂的对抗性攻击,使其在敏感应用中更加可靠。
排序理由 该集群包含一篇详细介绍 LLM 安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →