PulseAugur
中
实时 23:33:39

新的G2MAF框架在测试时优化多智能体策略

研究人员推出了一种名为梯度引导多智能体流(G2MAF)的新型框架,旨在优化测试时多智能体强化学习策略。该方法通过应用全局归一化、投影批评家梯度来解决冻结策略导致联合动作建议次优的问题。G2MAF引导智能体进行修正,同时确保动作的可行性并接近原始建议。在24个多智能体粒子环境(MPE)和SMAC设置的评估中,G2MAF改进了20个冻结策略,在MPE上平均相对增益为9.2%,在SMAC上为8.9%,推理延迟仅增加了6%。 AI

影响 通过在部署后提高策略性能,这项研究可能在实际应用中带来更高效、更适应性的多智能体系统。

排序理由 该集群包含一篇详细介绍多智能体强化学习新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的G2MAF框架在测试时优化多智能体策略

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Guowei Zou, Haitao Wang, Guoxin Wang, Zhiquan Chen, Beiwen Zhang, Guojie Wang, Hejun Wu ·

    G2MAF:多智能体流策略的测试时梯度引导

    arXiv:2609.31286v1 Announce Type: new Abstract: Offline multi-agent reinforcement learning (MARL) learns cooperative policies from fixed datasets without further environment interaction and a learned policy is frozen at deployment. Such a frozen policy typically proposes a single…