研究人员开发了一种新的AI模型后门攻击方法,该方法对训练后防御(如微调和剪枝)具有更强的抵抗力。该技术涉及将触发样本策略性地放置在干净数据分布的低密度区域,从而优化攻击成功率和干净准确率的保持。与现有方法相比,该方法在攻击成功率和对抗防御能力方面表现出更高的性能,表明当前防御策略存在根本性差距。 AI
影响 这项研究突显了当前AI防御的脆弱性,可能需要开发更强大的安全措施来对抗复杂的后门攻击。
排序理由 这是一篇详细介绍AI模型后门攻击新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →