研究人员调查了大型语言模型在多轮攻击中,有害性和拒绝表征的几何和时间动态。通过分析 Llama 3.1 8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 等模型在各种攻击框架下的表现,他们发现有害性表征在对话轮次中变得越来越可分离,尤其是在轮末标记处。这些有害性表征与拒绝相关的表征仅显示出微弱的一致性,这表明多轮攻击的成功并非通过内部抑制有害性,而是利用其随时间演变的可分离性。研究结果暗示,未来的安全防御应考虑这些时间动态,而不是仅仅依赖单轮探测。 AI
影响 通过强调多轮攻击中有害性表征的时间动态,为大型语言模型安全研究指明了新的方向。
排序理由 学术论文,详细介绍了关于大型语言模型安全的新研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
- ActorAttack
- arXiv
- crescendo
- Gemma-2-9B-it
- Hugging Face
- Llama 3.1 8B-Instruct
- Qwen2.5-7B-Instruct
- X-Teaming
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →