研究人员发现了一个新的预训练世界模型供应链漏洞,这些模型用作控制任务的模拟器。攻击者可以在模型检查点中嵌入后门,从而劫持下游控制器。这种攻击通过在存在触发器时微妙地重塑模型的潜在动态来实现,导致控制器在没有明确的触发器到动作规则的情况下采用攻击者期望的动作。中毒的模型仍然可以通过标准的干净数据诊断,在干净的任务上保持显著的性能,并且攻击的效果是时间门控的,在移除触发器时会消失。 AI
影响 突显了AI控制系统中的新攻击面,可能影响AI驱动应用程序的安全性。
排序理由 详细介绍AI模型新攻击向量的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Dreamer
- Hugging Face
- model predictive control
- When the World Lies: Backdoor Attacks on Latent World Models for Downstream Control
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →