研究人员开发了一种名为 Tripwire 的新防御机制,以保护大型语言模型 (LLM) 免受越狱攻击。该方法通过统计假设检验和效用特异性过滤器识别出安全相关的神经元。然后,Tripwire 将这些识别出的神经元固定到其有害条件下的平均激活值,从而触发模型已学习到的拒绝行为,而不会显著影响其效用。实验表明,Tripwire 将攻击成功率降低到最高 2.0%,同时在 MT-Bench 等基准测试中仅导致性能略有下降。 AI
影响 这项研究为防御大型语言模型免受对抗性攻击提供了一种更有效且性能下降更小的方法。
排序理由 该集群包含一篇详细介绍大型语言模型安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →