研究人员开发了SEMA,一个旨在改进针对大型语言模型的多轮越狱攻击的新型框架。SEMA采用两阶段过程:预填充自适应以生成结构化对抗性提示,以及具有意图漂移感知奖励的强化学习以维持有害目标。该方法在AdvBench等基准测试中取得了最先进的攻击成功率,显著优于现有方法。 AI
影响 这项研究为LLM的红队测试提供了一种更强大的方法,有可能加速安全漏洞的识别和缓解。
排序理由 该集群包含一篇详细介绍LLM安全研究新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →