研究人员引入了BadWAM,这是一个用于评估世界动作模型(WAMs)对抗性攻击的框架。这些攻击利用微小的视觉扰动来破坏WAMs的预期未来与其执行动作之间的一致性。该框架包含两种类型的攻击:一种优先考虑任务失败,另一种则在诱导有害动作的同时保持一个看似合理的预期未来,这表明任务成功率显著下降。 AI
影响 凸显了具身AI系统潜在的安全漏洞,需要强大的防御机制。
排序理由 该集群包含一篇研究论文,详细介绍了评估特定类型AI模型对抗性攻击的新框架。
- action-only adversarial attack
- arXiv
- BadWAM
- Hugging Face
- imagination-preserving adversarial attack
- World-Action Drift Attacks
- World-Action Models
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →