研究人员在基于LLM的多智能体系统中发现了一种新的漏洞,其中协作会无意中触发后门行为。这种情况发生在多个智能体的集体证据达到隐藏阈值时,而不是依赖于单个消息。为了解决这个问题,已经开发了一种名为边界条件后门注入(BCBI)的新范式,用于构建分离良性和对抗性目标的特定边界对。此外,还提出了一种名为潜在转换测试时评估(LATTE)的防御机制,用于学习正常的通信动态并隔离异常的智能体更新。 AI
影响 这项研究突显了协作式AI系统潜在的安全风险,需要为多智能体架构制定新的防御策略。
排序理由 该集群包含一篇学术论文,详细介绍了多智能体系统的新漏洞和防御机制。
在 arXiv cs.MA (Multiagent) 阅读 →
- arXiv
- Boundary-Conditioned Backdoor Injection
- LAtent Transition Test-time Evaluation
- LATTE
- multi-agent system
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →