研究人员引入了一种名为梯度免疫的新型防御机制,旨在保护已对齐的大语言模型免受恶意微调。该方法通过使用零空间立方层和逆向适配器实现,作为单向安全门(USG),即使在开放权重发布设置中大多数权重仍可训练的情况下,也能保持模型安全。USG通过识别校准保护区域内的隐藏状态,有效阻止来自有害数据样本的梯度,从而在保留安全样本效用的同时,保持微调后较低的攻击成功率。 AI
影响 这项研究可以显著增强开放权重LLM的安全性,使其更能抵抗对抗性攻击和滥用。
排序理由 该集群包含一篇详细介绍LLM安全新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- BeaverTails
- Gradient Immunity
- Inverse Adapter
- Null Space Cubic Layer
- Transformer++
- Unidirectional Safety Gate
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →