研究人员开发了一种名为零空间投影的新方法,用于净化使用 LoRA(低秩适应)进行微调的大型语言模型(LLM)。该技术旨在降低后门攻击的成功率,而无需预先了解触发器、干净的参考或激进的再训练。该方法将 LoRA 更新投影到输入和输出通道的正交零空间上,显著降低了攻击成功率,同时保留了模型的通用能力和新获得的下游技能。 AI
影响 为针对微调 LLM 的复杂后门攻击提供了一种新颖的防御手段,增强了模型的安全性和可信度。
排序理由 详细介绍 LLM 安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →