研究人员推出了一种新颖的去中心化多智能体强化学习(MARL)方法 Dreamer-CPC,该方法通过将集体预测编码(CPC)与 DreamerV3 世界模型相结合来增强通信。这种方法使智能体能够学习和交换反映历史观察和动作的消息,而不仅仅是当前的消息。在 Observer 和 CatchApple 环境中的评估表明,Dreamer-CPC 在现有方法中表现更优,尤其是在 CatchApple 环境中,其回合回报提高了 4 到 5 倍,突显了其在观察信息缺失情况下的协同决策能力。 AI
影响 这项研究可以改善去中心化人工智能系统中的协调,尤其是在信息不完整或延迟的情况下。
排序理由 该集群包含一篇详细介绍多智能体强化学习新方法的学术论文。
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →