PulseAugur
中
实时 14:11:45
实体 Attack Success Rates

Attack Success Rates

PulseAugur coverage of Attack Success Rates — every cluster mentioning Attack Success Rates across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_284730 ·

    新型回答侧后门攻击绕过大语言模型安全协议

    研究人员开发了一种针对大语言模型(LLM)的新型后门攻击,该攻击作用于回答侧而非输入侧。这种新颖的方法涉及一个良性的初始提示,导致LLM生成一个特定词语,该词语随后嵌入对话历史中作为触发器。当后续出现有害查询时,模型会识别出自身生成的触发器并绕过安全协议,即使用户的输入是干净的。这种回答侧后门攻击在低中毒率下实现了对多个LLM近乎完美的攻击成功率,规避了当前以输入为中心的防御措施,并凸显了LLM安全对齐方面的一个重大漏洞。