PulseAugur
实时 08:39:10

独立学习在具身多智能体强化学习中优于集中式方法

一篇题为“Embodiment-Induced Coordination Regimes in Tabular Multi-Agent Q-Learning”的新研究论文探讨了多智能体强化学习中不同协调策略的有效性。研究发现在捕食者-猎物网格世界场景中,完全独立的学习(IQL-IQL)优于完全集中的学习(CQL-CQL),即使在代理速度和耐力受到限制的情况下也是如此。研究人员提出了一个名为“时间同步锁定”的现象,其中共享价值函数会通过迫使能力强的代理等待能力有限的伙伴来阻碍学习,这表明集中式协调并非普遍有益,并且在具身场景中可能表现不如独立学习。 AI

影响 挑战了集中式协调在多智能体强化学习中总是优于其他方法的假设,对深度多智能体强化学习方法具有启示意义。

排序理由 该集群包含一篇详细介绍多智能体强化学习新发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

独立学习在具身多智能体强化学习中优于集中式方法

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Muhammad Ahmed Atif, Nehal Naeem Haji, Mohammad Shahid Shaikh, Muhammad Ebad Atif ·

    Embodiment-Induced Coordination Regimes in Tabular Multi-Agent Q-Learning

    arXiv:2601.17454v2 Announce Type: replace-cross Abstract: Centralized value learning underlies a broad class of multi-agent reinforcement learning methods, but its claimed advantage is typically evaluated in settings that confound coordination structure with function approximatio…