PulseAugur
实时 06:18:28
实体 JailMeter extsubscript{SLM}

JailMeter extsubscript{SLM}

PulseAugur coverage of JailMeter extsubscript{SLM} — every cluster mentioning JailMeter extsubscript{SLM} across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_151938 ·

    新的框架出现以评估和防御LLM越狱 · 跟踪4个来源

    研究人员正在开发新的方法来评估和防御大型语言模型(LLM)的越狱攻击。一种方法,不完整的提示越狱(IPJ),侧重于LLM如何延迟拒绝有害提示直到句子终止,并提出神经元级别的干预措施进行防御。另一个框架JailMeter使用信息瓶颈理论来更可靠地评估越狱的有效性,并取得了高精度。此外,Jailbreak Foundry提供了一个系统,将越狱论文翻译成可执行模块,用于可复现的基准测试,从而标准化不同模型和攻击的评估。