研究人员开发了几个新框架来解决多智能体辩论(MAD)系统的安全和评估挑战。MAD使用多个AI智能体进行辩论和完善答案,但可能容易受到传播错误或制造虚假共识的对抗性攻击。例如,MADBench对各种攻击类型下的这些安全漏洞进行了基准测试。MiniRep提供了一个基于声誉的稳健聚合系统,该系统同时考虑当前任务行为和历史声誉来对抗恶意智能体。JuryFlow引入了一个人工干预的循环方法,该方法使用法官之间的分歧作为改进信号,逐步完善评估标准。此外,主动溯源门(APG)作为一个辩论后验证层,用于防止未经支持的声明,并在无法可靠形成共识时发出分歧信号。 AI
影响 这些进展旨在提高使用辩论进行复杂决策和推理的AI系统的可靠性和安全性。
排序理由 多篇研究论文介绍了多智能体辩论系统的新框架和基准测试。
- Active Provenance Gate
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- JuryFlow
- Litmaps
- MADBench
- multi-agent debate
- ScienceCast
- Scite
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →