Multi-agent reinforcement learning
PulseAugur coverage of Multi-agent reinforcement learning — every cluster mentioning Multi-agent reinforcement learning across labs, papers, and developer communities, ranked by signal.
- 2026-05-21 research_milestone Researchers demonstrated superhuman performance and safety in quadrotor racing using multi-agent reinforcement learning. 来源
- 2026-05-21 research_milestone A new paper demonstrates superhuman performance and safety in multi-agent drone racing using reinforcement learning. 来源
10 天有情绪数据
-
新的基于PINN的框架求解复杂HJI方程
研究人员开发了一个新框架,将动态规划与物理信息神经网络(PINNs)相结合,以求解称为Hamilton--Jacobi--Isaacs(HJI)方程的复杂数学方程。该方法旨在处理高维和非凸HJI方程,这些方程在随机微分博弈和鲁棒控制等领域至关重要。所提出的方法在求解线性偏微分方程和使用自动微分更新控制策略之间交替进行,并展示了可证明的稳定性和收敛性。数值实验表明了该方法的准确性和可扩展性,在某些应用中优于直接PINN求解器,并显示出在…
-
新的XAI引导框架优化离线多智能体网络切片
研究人员开发了XAI-CODE,一个新颖的离线多智能体强化学习框架,专为未来6G及更高版本网络的网络切片设计。该方法利用可解释AI来指导去中心化执行,在部署期间无需智能体间通信或环境交互。XAI-CODE旨在最小化每个切片的延迟,同时防止资源冲突,在模拟中显示零冲突,并与现有的在线方法相比显著降低了信令开销和推理延迟。
-
新的MARL方法增强了水下无人机协同目标跟踪能力
两篇新研究论文介绍了用于自主水下航行器(AUV)网络协同目标跟踪的先进多智能体强化学习(MARL)技术。第一篇论文SDA-MARL提出了一种分层架构和一种扩散辅助算法,以解决策略非平稳性、学习效率低下和策略漂移问题。第二篇论文VGG-MADiffRL在分层控制框架内提出了一种价值梯度引导的方法,以克服高维状态-动作建模和对噪声敏感的策略等挑战。两种方法在模拟水下环境中都显示出改进的收敛性、跟踪精度和稳定性。
-
新框架提高机器人多智能体通信效率
研究人员开发了一种新颖的多智能体强化学习系统框架,可在带宽受限的环境中显著提高通信效率。通过整合信息瓶颈理论和矢量量化,该系统学会了压缩和离散化通信消息,同时保留了关键任务信息。该方法包括一个动态机制,根据智能体状态和环境上下文确定通信的必要性。实验表明,在减少带宽使用量的情况下,性能比基线有显著提升,优于现有的通信策略,并为机器人集群和自动驾驶车队等应用提供了理论依据的解决方案。
-
新架构将大型语言模型集成到智能制造的多智能体系统中
一篇新研究论文提出了一个参考架构,用于将大型语言模型(LLM)集成到智能制造的多智能体强化学习(MARL)系统中。该架构将LLM的集成点分为策略、奖励设计、智能体间通信和分层规划。虽然传统的MARL在结构化、实时协调方面表现出色,但LLM在语义解释、奖励生成和较慢的监督规划方面显示出潜力,尽管它们尚未在安全关键控制方面证明等效性。
-
新的MARL框架大幅缩短边缘计算中XR流量延迟
研究人员开发了一种新的多智能体强化学习(MARL)框架,用于改善时间敏感型网络(TSN)环境中的流量调度,特别适用于移动边缘计算(MEC)中的扩展现实(XR)等应用。提出的异构智能体近端策略优化(HAPPO)算法将每个TSN队列建模为一个可以与其他队列协调的独立智能体。该方法旨在解决动态流量条件下静态调度方法的局限性。模拟显示,该MARL框架将平均帧等待时间减少了高达26.8%,最坏情况延迟减少了约16.8%。
-
新型MCHA架构提升并行-顺序计算性能
研究人员开发了一种名为MCHA的新硬件架构,旨在加速并行-顺序计算任务。该架构通过采用分层通信策略来减轻主内存的负担,从而解决了传统系统中的瓶颈问题。MCHA还包含一个新颖的编程模型,使用事件驱动触发器来隐藏数据传输延迟。基准测试表明,与NVIDIA A100 GPU相比,MCHA在多智能体强化学习工作负载方面实现了153倍至2400倍以上的显著加速,同时大幅减少了主内存访问。
-
新的MCHA架构在MARL工作负载上实现了高达2456倍的加速
研究人员开发了一种名为MCHA的新硬件架构,旨在加速并行-顺序计算任务。该架构通过采用分层通信策略来减少主内存负载,从而解决了传统系统中的瓶颈问题。MCHA还包含一种新颖的编程模型,可以隐藏数据传输延迟。基准测试表明,与NVIDIA A100 GPU相比,MCHA在多智能体强化学习(MARL)工作负载上实现了153倍到2400多倍的显著加速,同时大幅减少了主内存访问。
-
研究发现:AI协调算法对实现细节表现出鲁棒性
一项新的研究论文探讨了AI中零样本协调(ZSC)算法的鲁棒性,特别检查了实现细节如何影响其性能。该研究引入了一种“跨实现交叉博弈”评估方案,以测试ZSC算法在随机种子或神经网络架构之外的变化。研究结果表明,对于“Other-Play”ZSC算法,标准的评估方法可以合理地替代更彻底的跨实现测试。
-
新的MARL框架优化无线资源管理
研究人员开发了HeLyMARL,一个新颖的异构多智能体强化学习框架,旨在优化密集无线网络中的无线资源管理。该框架通过采用具有虚拟队列的Lyapunov嵌入方法,解决了与有限时间预算约束和非线性效用函数相关的挑战。仿真表明,HeLyMARL在确保不间断服务的同时有效地平衡了吞吐量和公平性,其性能优于现有基准,且不会过早耗尽预算。
-
新框架超越外在指标评估MARL策略最优性
研究人员开发了一个新的信息论框架来评估多智能体强化学习(MARL)策略,超越了传统的奖励曲线等外在指标。这种新颖的方法使用收敛的蒙特卡洛树搜索作为基线来计算有界策略最优性得分,该得分会惩罚协作遗漏。该框架提供了细粒度的
-
新研究探索使用符号选项和合作进化策略训练的 LLM Agent
研究人员正在探索训练大型语言模型 (LLM) 作为复杂环境中 Agent 的新方法。一种方法,在一篇新的 arXiv 论文中详细介绍,使用“前沿编码模型”为 Agent 生成符号选项,然后使用多 Agent GRPO (PA-MAGRPO) 的变体和 LoRA 适配器进行训练。该方法旨在通过关注行为评估来提高 Agent 的性能,超越简单的奖励最大化,因为单独的奖励可能是真正合作的不可靠指标。另一篇论文介绍了一种用于资源受限的 LLM…
-
新神经网络框架提升多机器人任务调度能力
研究人员开发了一种新的分布式多机器人任务分配(MRTA)神经网络调度框架,旨在克服现有方法的局限性。该框架包括用于策略生成的“多解码器图注意力模型”(MDGAM)和用于训练的“无批评者组相对多智能体策略梯度”(GRMAPG)算法。MDGAM通过联合更新节点和边缘特征并使用多个解码器进行任务选择和通信消息传递来增强协调能力。实验表明,与传统的启发式和基于学习的方法相比,该方法在通信受限的情况下提高了任务完成性能。
-
基于GNN的多智能体强化学习框架将交通波减少80%
研究人员开发了一种新的去中心化多智能体强化学习(MARL)框架,该框架利用图神经网络(GNN)来管理交通波。这种方法允许联网和自动驾驶汽车(CAVs)仅使用本地信息和与附近车辆的交互来学习协作控制策略,使其在早期车联网(VANETs)中具有实用性。模拟表明,即使只有10%的车辆联网,这种基于GNN的MARL系统也能将交通波传播减少高达80%。
-
New Transformer Framework Bridges MARL to SARL for Enhanced Coordination
研究人员开发了共识多智能体Transformer(CMAT),一个旨在弥合合作多智能体强化学习(MARL)与分层单智能体强化学习(SARL)的新型框架。CMAT使用Transformer编码器处理大型联合观测空间,并通过分层决策机制解决广泛的联合动作空间问题。该机制自回归地生成一个高级共识向量,使智能体能够在潜在空间中就策略达成一致,并同时生成与顺序无关的动作。在StarCraft II、Multi-Agent MuJoCo和Goog…
-
AI框架解决降级监控下的航空交通冲突
研究人员开发了一个使用深度Q网络的(Deep Q-Networks)多智能体强化学习框架,用于管理航空走廊内不同类型飞机之间的冲突,特别是在监控数据不可靠的情况下。该系统为无人机和电动垂直起降飞机(eVTOL)训练了独立的策略,并纳入了通信延迟和信息丢失等各种现实世界条件。评估表明,该框架能在1秒内有效解决大多数冲突,智能体大部分时间保持航线,并在冲突期间利用转向、速度控制和垂直机动。研究还通过帕累托最优配置(Pareto-optim…
-
新的MAPS架构增强了交叉路口自动驾驶汽车的协调能力
研究人员开发了主代理原型规划系统(MAPS),这是一种新颖的层次化深度强化学习架构,旨在改善无信号灯交叉路口自动驾驶汽车之间的协调。MAPS利用一个集中的主代理生成紧凑的“原型计划”嵌入,然后由去中心化的工作代理将其与本地观测结合起来进行车辆控制。这种方法有效地将战略意图与战术执行分离,允许独立模块优化。在HighwayEnv模拟中的评估表明,MAPS能够实现无碰撞导航并显著减少行程时间,其性能优于现有方法,并且在比初始训练时更多的代…
-
MARL模型复制鱼群集体行为与社会觅食行为
研究人员开发了一个新颖的计算框架,利用多智能体强化学习(MARL)来研究弱电鱼群的集体行为。该模型成功复制了真实鱼类行为的关键方面,包括觅食模式和放电器官放电统计数据。该框架允许进行计算机干预,以了解社会觅食行为的驱动因素,并分析神经动力学以揭示任务相关信息和社会背景是如何被编码的。
-
新分析揭示多智能体策略优化的最优聚合方法
一篇新的研究论文介绍了一种合作多智能体策略优化的规范形式分析,重点关注如何聚合来自邻近智能体的信息。该研究形式化了两个关键的设计选择,即支持矩阵 SA 和 SR,并证明它们的乘积决定了优化目标。研究结果表明,在优势(advantage)方面聚合邻近智能体有利于奖励信号,而保持每个智能体的比例(ratio)最优则有利于似然比(likelihood ratios),以避免方差的指数增长。
-
提出用于弹性关键基础设施的去中心化MARL · 跟踪2个来源
本文提出将去中心化多智能体强化学习(MARL)作为一种增强关键基础设施弹性的范式。文章认为,MARL的扩展性、隐私性、鲁棒性和自适应交互等特性,非常符合复杂分布式系统的需求。研究强调了信用分配和通信是这些环境中实际部署MARL的关键挑战,并概述了解决这些问题的未来研究议程。