PulseAugur
实时 20:37:26
English(EN) How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

新框架评估越狱攻击以改进LLM安全

研究人员推出A-MESS,一个从防御者角度评估大型语言模型越狱攻击的新框架。该方法侧重于攻击如何有效地通过红队测试和训练来改进模型安全,而不是仅仅关注其破解模型的成功率。A-MESS估算AttackSHAP分数,将边际效用归因于单个攻击,并选择最优子集以改进安全性,证明了这种以防御者为中心的效用与传统的以攻击者为中心的指标只有微弱的对齐关系。 AI

影响 这项研究重新构建了对越狱攻击的评估方式,可能为LLM带来更有效的安全训练数据选择。

排序理由 学术论文,介绍了一种用于LLM越狱攻击的新评估框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架评估越狱攻击以改进LLM安全

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Yukai Zhou, Feiyang Lu, Xiaokai Mao, Jinfei Liu, Wenjie Wang ·

    越狱攻击如何为安全对齐提供信息:一种以防御者为中心、基于Shapley的越狱贡献评估

    arXiv:2607.17152v1 Announce Type: cross Abstract: Jailbreak attacks on large language models are usually evaluated by attacker-centric metrics such as attack success rate (ASR), yet an attack that breaks a model is not necessarily useful for improving its safety. We propose a def…