研究人员开发了一个自动框架,用于生成困难示例,以测试和提高多模态大型语言模型 (MLLM) 的鲁棒性。该代理红队测试系统使用多代理架构,包括一个高推理能力的 Architect 代理和 LLM 评估员,以自主发现突破边界的违规行为和模糊的策略边缘情况。通过使用这些合成的对抗性示例,该系统在没有人工干预的情况下,将公开图像安全基准的错误否定率 (FNR) 从 41.2% 降低到 24.5%。 AI
影响 增强了 MLLM 在对抗性攻击和边缘情况下的安全性和鲁棒性,可能导致更可靠的内容审核系统。
排序理由 该集群描述了一篇发表在 arXiv 上的研究论文,该论文详细介绍了一种用于合成对抗性示例以提高 MLLM 鲁棒性的新方法。
在 arXiv cs.MA (Multiagent) 阅读 →
- alphaXiv
- Architect agent
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- LLM raters
- Multimodal Large Language Models
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →