研究人员开发了一种名为利他与公平偏好(AFP)的新效用函数,旨在促进多智能体强化学习(MARL)系统中的合作,特别是在个体激励与集体福祉相冲突的社会困境场景中。通过整合对他人奖励的偏好和对公平结果的偏好,AFP智能体在序列社会困境游戏中表现出比标准强化学习智能体更成功的互助合作和更高的公平性。研究发现,利他偏好驱动对公共物品的贡献,而公平偏好则促进智能体之间的互惠行为。 AI
影响 引入了一种促进多智能体AI系统合作的新方法,有望改善复杂环境中的协调性。
排序理由 学术论文,详细介绍了MARL的新效用函数。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →