PulseAugur
实时 10:03:55
English(EN) Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

新的Fair-ASR协议重新评估LLM越狱,引入高效ReCode攻击

研究人员推出了一种名为Fair-ASR的新协议,用于评估GPT-5等大型语言模型的越狱攻击。该方法通过使用共享的目标调用预算来标准化比较,解决了先前依赖FLOPs或忽略预算限制的评估方法的局限性。研究发现,传统的攻击方法仍然具有竞争力,并引入了一种新颖、预算高效的ReCode攻击,该攻击在GPT-5上取得了85%的成功率,且攻击者调用次数显著减少。 AI

影响 为LLM安全评估建立了更严格的标准,可能导致更强大的越狱防御措施。

排序理由 该集群报道了一篇介绍LLM新评估协议和攻击方法的新学术论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的Fair-ASR协议重新评估LLM越狱,引入高效ReCode攻击

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang ·

    Fair ASR:在共享目标调用预算下重新评估黑盒越狱

    arXiv:2608.17360v1 Announce Type: cross Abstract: Reliable jailbreak evaluation is essential for assessing LLM safety, but most existing studies rely solely on attack success rate (ASR) without accounting for its dependence on attack budgets, resulting in unfair comparisons acros…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    Fair ASR:在共享目标调用预算下重新评估黑盒越狱

    Reliable jailbreak evaluation is essential for assessing LLM safety, but most existing studies rely solely on attack success rate (ASR) without accounting for its dependence on attack budgets, resulting in unfair comparisons across methods. Existing compute-aware evaluations redu…