研究人员开发了一种名为置信度调度受限响应(CS-RNR)的新方法,用于在不完美信息游戏中进行博弈的智能体。该技术允许智能体自我认证其漏洞,确保任何偏离纳什均衡策略的行为都经过安全审计。CS-RNR使用置信度序列来确定何时可以利用对手的行为,然后生成候选的应对策略。在Leduc扑克上的测试中,CS-RNR在保持安全保证的同时,取得了比以前的方法显著更高的收益。 AI
影响 引入了一种新颖的方法,使AI智能体能够在复杂游戏中安全地利用有缺陷的对手,从而可能提高AI在战略场景中的性能。
排序理由 该集群包含一篇详细介绍AI智能体在博弈论中新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →