研究人员开发了用于信息不对称的去中心化多玩家强化学习在片段式马尔可夫决策过程(MDP)中的新算法。提出的方法 mQ-learning、mQ-learning-intervals、mEXC 和 mEXC-Bellman 解决了未观察到的动作以及独立或共同奖励的情况。与集中式学习相比,这些算法实现了具有竞争力的遗憾界限,尤其是在玩家数量较少或动作集有限的情况下。 AI
影响 引入了可能推进多智能体强化学习能力的新算法。
排序理由 详细介绍强化学习新算法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →