PulseAugur
实时 12:00:57
实体 AutoDAN

AutoDAN

PulseAugur coverage of AutoDAN — every cluster mentioning AutoDAN across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_126255 ·

    新的响应时间探测方法提高了 LLM 对预填充攻击的安全性

    研究人员开发了一种名为响应时间探测的新方法,通过检测预填充攻击来增强大型语言模型的安全性。该技术通过在第一个生成的 token 处探测模型的隐藏状态,在七种不同的模型上实现了 0.97-1.00 的 AUROC。当与暂停机制结合使用时,它将预填充攻击的成功率降至 0%,且没有良性误报,优于 Llama Guard 3 等现有防御措施。当这种响应暂停与 AlphaSteer 的零空间引导相结合时,取得了进一步的改进,实现了超过 0.98…

  2. RESEARCH · CL_58559 ·

    新研究揭示了 LLM 和 LALM 的越狱漏洞不断升级

    三篇新研究论文探讨了大型语言模型 (LLM) 和大型音频语言模型 (LALM) 的漏洞和防御。第一篇论文详细介绍了音频越狱攻击和防御的分类法,强调目前的防御措施通常会牺牲可用性来换取鲁棒性。第二篇论文全面回顾了 LLM 的漏洞,对攻击和防御进行了分类,并指出了在弹性对齐和自动检测等领域的研究空白。第三篇论文介绍了“越狱规模定律”,证明了对抗性提示如何将攻击成功率从多项式增长转变为指数增长,这种现象在各种 LLM 和攻击方法中都有观察到。