研究人员推出A-MESS,一个从防御者角度评估大型语言模型越狱攻击的新框架。该方法侧重于攻击如何有效地通过红队测试和训练来改进模型安全,而不是仅仅关注其破解模型的成功率。A-MESS估算AttackSHAP分数,将边际效用归因于单个攻击,并选择最优子集以改进安全性,证明了这种以防御者为中心的效用与传统的以攻击者为中心的指标只有微弱的对齐关系。 AI
影响 这项研究重新构建了对越狱攻击的评估方式,可能为LLM带来更有效的安全训练数据选择。
排序理由 学术论文,介绍了一种用于LLM越狱攻击的新评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →