PulseAugur
实时 06:44:29
实体 LLM jailbreak attacks

LLM jailbreak attacks

PulseAugur coverage of LLM jailbreak attacks — every cluster mentioning LLM jailbreak attacks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_221109 ·

    新型防御框架演化以对抗LLM越狱攻击

    研究人员开发了一种针对大型语言模型(LLM)越狱攻击的新型防御机制。该自演化框架使用持久化规则内存,能够实时适应新的攻击策略,而无需更新模型参数。当攻击成功时,系统会将攻击的结构性包装抽象成一个通用规则,并将其应用于未来的输入。该方法已证明在各种模型和攻击家族中显著降低了攻击成功率,同时保持了效用并避免了过度拒绝率的增加。