研究人员开发了一种名为机制性异常检测(MAD)的新方法,将异常检测重新构建为功能归因问题。该方法使用影响函数来衡量测试样本与参考集之间的耦合,并在归因失败时标记异常行为。该方法在检测视觉模型中的后门方面表现出最先进的性能,并且在大型语言模型(LLM)方面显示出显著的改进,即使是针对混淆模型。除了后门,MAD还可以识别对抗性样本和分布外样本,为识别已部署AI系统中的异常行为提供了一种模型无关的工具。 AI
影响 提供了一种新颖的、模型无关的方法来检测AI模型中隐藏的漏洞和异常行为。
排序理由 该集群包含一篇详细介绍AI安全研究新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →