实体
prisoner's dilemma
prisoner's dilemma
PulseAugur coverage of prisoner's dilemma — every cluster mentioning prisoner's dilemma across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Equilibrium stability drives cooperation in Q-learning algorithms
一篇新的研究论文探讨了在探索不会随时间消失的情况下,均衡稳定性如何驱动Q学习者之间的合作。该研究聚焦于重复的囚徒困境,分析了持续适应的算法所采用的合作策略的时间平均比例。研究人员推导出了一个预测非背叛主导行为何时出现的边界条件,并通过对epsilon-greedy Q学习的大量模拟进行了验证。
-
新方法引导多智能体AI走向特定均衡
研究人员开发了一种新的多智能体策略梯度方法,使其能够收敛到特定的纳什均衡。该方法称为对手感知盆地进入,使用同伴学习纠正机制来引导智能体进入由外部标准(如支付主导)选择的均衡。在各种游戏环境中进行的实验表明,与标准的策略梯度相比,这种同伴感知更新策略增加了进入合作盆地的可能性。