SMACv2
PulseAugur coverage of SMACv2 — every cluster mentioning SMACv2 across labs, papers, and developer communities, ranked by signal.
-
新指标分析多智能体强化学习中的奖励归因效应
一篇新的研究论文介绍了 EffRank/$n$ 和 $D_ ext{act}$ 这两个指标,旨在分析奖励归因如何影响合作式多智能体强化学习 (MARL) 系统中学习到的表征。该研究在 SMACv2 protoss_5_vs_5 环境中的 MAPPO 智能体上测试了这些指标。研究结果表明,虽然个体奖励会导致更明确的智能体角色和行为,但学习到的表征的几何特性主要受单位类型观察的影响,而非奖励结构本身。
-
New framework measures coordination gap in cooperative MARL systems
研究人员开发了一个新框架,用于衡量合作多智能体强化学习(MARL)系统中的协调结构。该框架分析了理论角色分配与去中心化智能体实际学到的约定之间的差距。该研究利用了 MiniGrid 和 SMACv2 等环境,采用标签条件注意力来实现更具角色特异性的路由,这种路由在不同团队规模下保持稳定,并且对盟友槽填充具有不变性。
-
多智能体强化学习研究量化了理论与学习到的智能体角色之间的协调差距
一篇新研究论文探讨了合作式多智能体强化学习(MARL)系统中的协调机制。该研究调查了理论角色分配与智能体实际学到的协调约定之间的差距。研究结合了角色路由矩阵和注意力机制等方法,证明了与简单的基线模型相比,标签条件注意力能够实现更聚焦、更具角色特异性的路由。这种方法在不同团队规模下表现出稳定性,并且可以零样本迁移到新的团队配置,为分析MARL协调结构提供了一个框架。
-
NonZero算法增强了多智能体MCTS的探索能力,以实现更好的协调
研究人员推出了一种新颖的方法NonZero,用于增强合作多智能体场景下的蒙特卡洛树搜索(MCTS)。该方法通过在低维表示中使用交互引导的提议规则来解决传统MCTS的可扩展性问题,避免了对完整联合动作空间的枚举。NonZero利用交互分数来识别协调优势,并在MatGame、SMAC和SMACv2的实证测试中展示了更高的样本效率和性能。