研究人员推出了一种名为“隔离专家关闭”(QES)的新策略,用于遏制大型语言模型中的后门。与先前阻止后门形成或在训练后净化模型的旧方法不同,QES允许后门形成,但将其隔离在指定的“专家”组件内。然后,可以在部署时通过简单操作禁用此隔离组件,从而在不重新训练或进行广泛过滤的情况下有效中和后门。实证结果表明,QES在很大程度上保留了模型的通用效用的同时,显著降低了攻击成功率。 AI
影响 通过隔离和禁用后门,为大型语言模型安全引入了一种新方法,有可能提高已部署模型的安全性和可靠性。
排序理由 该集群包含一篇详细介绍大型语言模型安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →