研究人员开发了一种名为 MEASER 的新方法,用于在开源大语言模型中嵌入恶意软件。该技术针对特定参数注入恶意载荷和触发器,旨在逃避检测,即使在模型量化或微调后也能奏效。在几个流行大语言模型上的实验表明,MEASER 具有很高的隐蔽率,并且在不显著降低性能的情况下有效传递载荷。 AI
影响 针对开源大语言模型的新攻击向量可能需要新的模型部署安全协议。
排序理由 详细介绍针对开源大语言模型新攻击方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →