PulseAugur
实时 11:01:09
English(EN) DYNASHIELD: A Black-Box Moving Target Defense for LLMs via Dynamic Decoding Customization

DYNASHIELD:新型防御措施保护 LLM 免受越狱攻击

研究人员开发了 DYNASHIELD,这是一种旨在保护大型语言模型 (LLM) 免受越狱攻击的新型防御机制。这种黑盒方法在推理时定制解码超参数和系统提示,引入变异性以破坏对抗性提示。DYNASHIELD 在无需访问模型内部或重新训练的情况下运行,使其适用于 API 部署的服务。在七个开源 LLM 上的评估表明,在保持响应质量并产生最小开销的同时,攻击成功率显著降低。 AI

影响 这种防御机制提供了一种实用、轻量级的解决方案,可在无需重新训练模型的情况下增强 LLM 对抗对抗性攻击的安全性。

排序理由 该集群包含一篇详细介绍 LLM 安全新方法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DYNASHIELD:新型防御措施保护 LLM 免受越狱攻击

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Xiaoqun Liu, Weiming Qi, Qiben Yan ·

    DYNASHIELD:通过动态解码定制实现的LLM黑盒移动目标防御

    arXiv:2412.07672v2 Announce Type: replace-cross Abstract: Large language models (LLMs) remain vulnerable to jailbreak attacks in which adversarial prompts induce harmful outputs. Existing defenses often require access to the model internals or additional training, limiting their …