一篇新研究论文介绍了一种名为TARE的方法,旨在更准确地评估AI模型中后门防御的成本。传统方法衡量干净准确率的下降,这可能具有误导性,因为它无法区分防御对模型的影响和后门的实际移除。TARE通过在一个“永不被投毒的双生模型”上运行防御来解决这个问题,从而允许研究人员通过衡量双生模型损失的性能来分离防御的真实成本。该论文还提供了诸如签名TARE列和TARE-Z(用于种子稳定防御的估计器)等工具,以改进这些安全措施的评估。 AI
影响 引入了一种更准确的评估AI安全防御的方法,可能有助于开发更强大的模型。
排序理由 该集群包含一篇详细介绍评估AI安全防御新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- BackdoorBench
- CIFAR-100
- FT-SAM
- Input-Aware Dynamic Backdoor Attack
- MultiStepLR
- Neural Cleanse
- PreAct-ResNet18
- TARE
- VGG19-BN
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →