Mappō
PulseAugur coverage of Mappō — every cluster mentioning Mappō across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的OGR-MARL框架增强了USV的协同追击能力
研究人员开发了OGR-MARL,一个新颖的多智能体强化学习框架,专为受限港口水道中异构无人水面载具(USV)的协同追击场景设计。该框架集成了共享逃避者信念、角色条件选项目标和自适应规则惩罚,使MARL算法能够学习纠正性动作,而不是从头开始。当使用各种MARL骨干实例化时,OGR-MASAC展示了75.0%的捕获率和卓越的协调性,并通过零样本迁移到更复杂的地图显示出有希望的泛化能力。
-
多智能体强化学习增强了稀疏网络中的无人机部署和通信
两篇新研究论文探讨了多智能体强化学习在优化无人机(UAV)部署和通信方面的应用。第一篇论文介绍了一个去中心化协同无人机部署框架,在通信受限的情况下,与现有方法相比,目标覆盖率提高了12%。第二篇论文提出了一种面向容忍延迟网络的无人机飞行和机会路由联合优化方法,与传统路由协议相比,显示出显著的收益。
-
新指标分析多智能体强化学习中的奖励归因效应
一篇新的研究论文介绍了 EffRank/$n$ 和 $D_ ext{act}$ 这两个指标,旨在分析奖励归因如何影响合作式多智能体强化学习 (MARL) 系统中学习到的表征。该研究在 SMACv2 protoss_5_vs_5 环境中的 MAPPO 智能体上测试了这些指标。研究结果表明,虽然个体奖励会导致更明确的智能体角色和行为,但学习到的表征的几何特性主要受单位类型观察的影响,而非奖励结构本身。
-
新分析揭示多智能体策略优化的最优聚合方法
一篇新的研究论文介绍了一种合作多智能体策略优化的规范形式分析,重点关注如何聚合来自邻近智能体的信息。该研究形式化了两个关键的设计选择,即支持矩阵 SA 和 SR,并证明它们的乘积决定了优化目标。研究结果表明,在优势(advantage)方面聚合邻近智能体有利于奖励信号,而保持每个智能体的比例(ratio)最优则有利于似然比(likelihood ratios),以避免方差的指数增长。
-
新的PRIME框架可恢复多智能体AI系统中的休眠神经元
研究人员开发了PRIME(Plasticity Recovery In Multi-agent Environments,多智能体环境中的可塑性恢复)框架,旨在解决多智能体强化学习系统中休眠神经元的问题,尤其是在动态环境中。与以往假设条件固定或仅对外部变化做出反应的方法不同,PRIME关注网络的内部状态。它识别并安全地重新初始化激活休眠且梯度静默的神经元,从而在不破坏有用表征的情况下恢复学习能力。在无人机应急通信模拟器上进行测试,PR…
-
新的MARL框架通过延迟感知提升空中目标定位精度
研究人员开发了一个新的多智能体强化学习框架,旨在提高空中目标三维定位的精度,特别是在反无人机应用中。该框架通过将信息年龄(AoI)纳入观测,解决了检测、通信和决策中的累积延迟问题。实验表明,与假设瞬时反馈的方法相比,这种延迟感知的⽅法显著提高了三角测量有效性并降低了均方根误差。
-
新系统Pharos提升城市空域无人机安全性
研究人员开发了Pharos,一个专为复杂城市环境设计的新型多无人机空域管理系统。该系统旨在通过防止碰撞和减轻人类恐惧来提高安全性,定位在完全分布式和集中式控制范式之间。Pharos利用MAPPO算法进行高效协调,与现有基准相比,在减轻人类恐惧方面提高了52%以上,并提高了70%的空间利用率。
-
新的DRL框架优化城市电动汽车车队控制
研究人员开发了一个新的城市电动汽车(EV)车队控制框架,该框架使用分布鲁棒强化学习(DRL)来处理不确定的需求和出行时间。这种名为PD-RSAC的方法可以优化调度、重新定位和充电决策,同时严格遵守充电器和馈线容量限制。使用纽约市出租车数据进行的实验表明,PD-RSAC将净利润显著提高到122万美元,优于各种启发式和强化学习基线。
-
研究发现MARL基准测试可能不需要复杂的推理
一篇新发表在arXiv上的研究论文对当前合作式多智能体强化学习(MARL)基准测试的有效性提出了质疑。该研究引入了诊断工具来评估智能体是否真正采用了Dec-POMDP推理,这涉及到推断隐藏状态并基于局部信息进行协调。研究结果表明,许多流行的MARL基准测试并不需要这种复杂的推理,简单的反应式策略通常也能取得相当的性能。该研究认为,当前的训练范式可能导致对进展的评估过高,并呼吁在该领域进行更严格的环境设计和评估。
-
研究人员开发用于城市规模电动汽车叫车服务的半马尔可夫强化学习
研究人员开发了一种新颖的半马尔可夫强化学习方法,用于优化城市规模电动汽车(EV)叫车车队。该方法解决了调度、重新定位和充电等复杂决策问题,同时遵守充电器和馈线限制等物理约束。该系统结合了高级意图和混合整数线性规划来确保可行性,并采用鲁棒优化技术来处理不确定的需求和出行时间。在基于纽约市出租车数据的模拟器中进行的实验表明,该方法显著优于现有基线,净利润达到122万美元。
-
研究人员开发用于电动汽车叫车服务的半马尔可夫强化学习,提高利润并确保可行性。
研究人员开发了一种新颖的半马尔可夫强化学习方法,用于管理大规模电动汽车叫车车队。该方法确保调度、重新定位和充电决策严格遵守充电器和馈线限制等物理约束,即使在需求和出行时间不确定的情况下也是如此。该系统利用掩码执行器产生高级意图,然后通过混合整数线性规划进行投影以保证可行性。在纽约市出租车数据集模拟器上的实验表明,名为 PD--RSAC 的方法显著优于基线方法,净利润达到 122 万美元,同时避免了任何馈线限制违规。