研究人员开发了一种方法,可以形式化地认证语言模型中安全分类器的鲁棒性,特别是基于状态空间模型(SSMs)的模型。他们证明了状态转移矩阵上的一个关键条件,即收缩条件($ orm{A}_ ext{inf}<1$),对于精确区间边界传播(IBP)认证是必需的。当满足此条件时,可以认证安全头对扰动输入的预测一致性,并且研究人员在有毒评论数据上展示了改进的认证比例。将收缩正则化的S4头应用于越狱检测任务,在AdvBench和HarmBench等基准测试中表现强劲,表明有害意图在嵌入空间中已经可以线性分离。 AI
影响 为认证AI安全分类器的鲁棒性建立了理论框架,有望带来更可靠的AI系统。
排序理由 学术论文,详细介绍了一种认证AI模型鲁棒性的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- AdvBench
- HarmBench
- Interval Bound Propagation
- JailbreakBench
- Mamba-130M
- Omanshu Thapliyal
- State Space Model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →