研究人员开发了 DYNASHIELD,这是一种旨在保护大型语言模型 (LLM) 免受越狱攻击的新型防御机制。这种黑盒方法在推理时定制解码超参数和系统提示,引入变异性以破坏对抗性提示。DYNASHIELD 在无需访问模型内部或重新训练的情况下运行,使其适用于 API 部署的服务。在七个开源 LLM 上的评估表明,在保持响应质量并产生最小开销的同时,攻击成功率显著降低。 AI
影响 这种防御机制提供了一种实用、轻量级的解决方案,可在无需重新训练模型的情况下增强 LLM 对抗对抗性攻击的安全性。
排序理由 该集群包含一篇详细介绍 LLM 安全新方法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →