研究人员开发了一种名为双模态多阶段对抗性安全训练(DMAST)的新方法,以提高多模态网络代理抵御复杂攻击的鲁棒性。这些代理能够处理来自网络界面的视觉和文本信息,容易受到跨模态攻击,即操纵内容同时影响两个观察通道。DMAST将这种交互形式化为一个博弈,并采用了一个三阶段的训练流程:模仿学习、Oracle引导的微调和对抗性强化学习。这种方法显著降低了攻击成功率,同时提高了在分布外任务上的完成度,优于现有防御措施。 AI
影响 增强了与网络环境交互的AI代理的安全性和可靠性,可能有助于更安全地部署多模态AI。
排序理由 该集群包含一篇详细介绍新研究方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DMAST
- Dual-Modality Multi-Stage Adversarial Safety Training
- Group Relative Policy Optimization
- Grpo
- Haoyu Liu
- MiniWoB++
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →