研究人员开发了一个名为正常扩散动力学学习(NDDL)的新框架,用于防御文本到图像扩散模型免受后门攻击。该方法侧重于扩散轨迹的转换动力学,观察到良性模型遵循结构化模式,而恶意攻击会导致偏差。NDDL仅使用干净数据学习这些正常的转换模式,并通过检测观察到的转换与预测转换之间的一致性来识别后门。该框架还可以通过替换低语义词来定位触发器,而无需事先了解攻击。 AI
影响 这项研究为保护生成式AI模型免受恶意攻击提供了一种新颖的方法,有望提高文本到图像系统的可信度。
排序理由 详细介绍AI模型安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →