研究人员开发了TRIM,一种新颖的黑盒防御系统,旨在推理过程中检测和移除深度神经网络(DNN)中的后门触发器。与先前需要访问模型内部或训练数据的方法不同,TRIM仅通过黑盒访问进行操作。它识别负责异常行为的图像区域,使用修复和基于扩散的重建来净化这些被操纵的区域,并保留良性内容。TRIM的有效性已在各种数据集和触发器类型中得到证明,显著降低了攻击成功率,同时保持了高清洁准确率。 AI
影响 为对抗复杂的AI后门攻击提供了一种新颖的推理时防御,增强了已部署深度神经网络的安全性。
排序理由 详细介绍检测和缓解AI安全威胁新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →