研究人员推出了一种新颖的训练时防御机制SEAL,旨在增强混合专家(MoE)大型语言模型的全局安全性。MoE架构仅为每个token激活一部分专家模块,功能强大但容易受到操纵专家激活的对抗性攻击。SEAL利用“共享专家”组件,即混合MoE模型中始终激活的部分,作为安全性的路由无关锚点。该方法旨在减轻稀疏路由引入的漏洞,并已证明在对模型能力影响极小的情况下,攻击成功率可降低高达60%。 AI
影响 引入了一种新方法来提高MoE模型在对抗性攻击下的安全性和鲁棒性。
排序理由 该集群包含一篇详细介绍LLM新防御机制的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →