PulseAugur
实时 11:19:57

新算法应对去中心化多玩家强化学习

研究人员开发了用于信息不对称的去中心化多玩家强化学习在片段式马尔可夫决策过程(MDP)中的新算法。提出的方法 mQ-learningmQ-learning-intervalsmEXCmEXC-Bellman 解决了未观察到的动作以及独立或共同奖励的情况。与集中式学习相比,这些算法实现了具有竞争力的遗憾界限,尤其是在玩家数量较少或动作集有限的情况下。 AI

影响 引入了可能推进多智能体强化学习能力的新算法。

排序理由 详细介绍强化学习新算法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新算法应对去中心化多玩家强化学习

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Larissa Xu, King Bi, William Chang ·

    信息不对称下,情节马尔可夫决策过程中的去中心化多智能体Q学习

    arXiv:2608.12753v1 Announce Type: new Abstract: We study decentralized multi-player reinforcement learning in episodic tabular Markov decision processes (MDPs) under three forms of information asymmetry: (A) unobserved actions with common rewards, (B) observed actions with indepe…