研究人员推出了一种名为Lilith的新框架,旨在解决机器学习模型的后门泛化问题。该框架专注于植入恶意行为,这些行为可以泛化到训练期间未见过的推理时触发器,这是现有后门研究在很大程度上忽略的一个漏洞。Lilith首先使用单个训练锚点创建一个紧凑的漏洞,然后构建一个保持表示几何的仅推理触发器族。实验表明,Lilith在实现高攻击成功率的同时,模型效用下降很小,触发器泛化差距也很小。 AI
影响 突显了一类新的后门攻击,可能影响依赖于多样化数据源的机器学习服务的安全性。
排序理由 详细介绍机器学习后门泛化新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →