Multi-agent reinforcement learning
PulseAugur coverage of Multi-agent reinforcement learning — every cluster mentioning Multi-agent reinforcement learning across labs, papers, and developer communities, ranked by signal.
- 2026-05-21 research_milestone Researchers demonstrated superhuman performance and safety in quadrotor racing using multi-agent reinforcement learning. 来源
- 2026-05-21 research_milestone A new paper demonstrates superhuman performance and safety in multi-agent drone racing using reinforcement learning. 来源
6 天有情绪数据
-
基础模型提升无线网络MARL效率
研究人员开发了一种新方法,利用基础模型来提高无线随机接入网络优化中多智能体强化学习(MARL)的效率。这一新方法在提交的arXiv论文中有所详述,它在去中心化的MARL架构中采用了一种基础模型辅助的actor-critic算法。所提出的系统旨在减少此类应用中MARL通常伴随的显著训练开销,为无线网络提供更快的优化速度。
-
AI混合设计赋能高效的机器人集群视觉导航
研究人员开发了一种新颖的、由AI驱动的为机器人集群设计分布式控制器的方法,使其能够在复杂环境中自主进行视觉导航。该方法结合了多智能体强化学习和神经进化策略,特别是使用交叉熵方法和协方差矩阵自适应进化策略来优化预训练的导航策略。该系统依赖于一个紧凑的神经网络,仅使用单目摄像头图像,优先考虑计算和能源效率,以实现实际的机器人集群部署。仿真实验表明,交叉熵方法控制器比协方差矩阵自适应进化策略的探索覆盖率提高了36.20%,并且基于视觉的策略…
-
AI框架通过LLM-MARL和神经符号方法推进无人机网络化
两篇新研究论文探讨了用于管理无人机(UAV)网络的先进人工智能技术。第一篇论文提出了一种分层混合架构,将大型语言模型(LLM)与多智能体强化学习(MARL)相结合,以动态适应低空无线网络中不断变化的服务需求和网络条件。第二篇论文介绍了一个神经符号智能体AI框架,旨在通过整合神经基础与符号推理来增强无人机自主性,以降低幻觉风险并提高泛化能力。
-
LLM增强的MARL优化电动汽车充电系统
研究人员开发了一个新框架,该框架使用大型语言模型(LLMs)来增强多智能体强化学习(MARL),以优化电动汽车充电系统。该方法通过使LLMs能够从物联网数据中选择重要特征,并动态平衡利润、用户满意度和电网负荷等优先级,从而解决了高维状态空间和冲突目标带来的挑战。实验表明,这种统一的循环在市场效率方面显著优于现有方法,并减少了70%以上的训练时间。
-
新研究探讨多智能体AI系统中的合作与通信 · 已追踪4个来源
研究人员开发了多智能体学习的新方法,重点在于增强人工智能智能体之间的合作与通信。一种方法,“具有合作驱动优化动态的多智能体学习”,提出小型神经网络可以通过共享预测和相互影响训练,集体表现优于单个大型神经网络。另一个框架,“多智能体正则化通信 (MARC)”,引入了一种新颖的鲁棒且高效的通信系统,特别是在通信瓶颈和有损信道下,这对于自动机器人网络等应用至关重要。
-
DRG-MAPPO框架通过分层角色分配提高空战胜率 · 已追踪2个来源
研究人员开发了DRG-MAPPO,一个旨在增强合作空战的新型多智能体强化学习框架。该系统集成了分层动态角色分配和基于图的关系建模,使智能体能够更好地理解和适应复杂、不断变化的战场交互。实验表明,DRG-MAPPO的胜率达到87%,证明了其在平衡战术策略、协同执行和可解释性方面的有效性。
-
RideSkill 算法使用 LLM 优化共享出行
研究人员开发了 RideSkill,这是一种新颖的分层算法,旨在优化通用共享出行操作。该方法解决了现有多种智能体强化学习方法的局限性,例如泛化能力差和训练困难,尤其是在车辆共享场景中。RideSkill 利用 LLM 辅助的自动算法设计来创建技能库、组合器和重新定位器,从而实现自适应调度和高效的车辆重新定位,而无需在实时部署期间调用 LLM。
-
综述论文详述多智能体AI决策方法
一篇新的综述论文详细介绍了多智能体协同决策领域的进展,该领域对于自动驾驶和灾难救援等复杂任务中的AI系统至关重要。论文将当前方法分为五类:基于规则(包括模糊逻辑)、基于博弈论、基于进化算法、基于深度多智能体强化学习(MARL)以及基于大语言模型(LLMs)推理。论文强调了MARL和基于LLM的方法的显著优势,并讨论了未来的研究方向和挑战。
-
新的决策变换器框架增强了无线资源管理
研究人员开发了一种新颖的混合离线-在线多智能体强化学习框架,称为决策变换器(Decision Transformers)。该方法首先使用现有轨迹上的监督序列建模进行离线策略预训练,确保安全高效的起点。然后,它使用包含评判器引导梯度(critic-guided gradients)的混合目标在线优化此策略,从而在初始离线策略之外实现性能提升。该框架采用了回报加权采样(return-weighted sampling)和邻域相关探索(ne…
-
研究发现:人工智能代理可能在电力市场中学会串通
一项新的研究论文探讨了人工智能代理在算法电力市场中进行默示串通的可能性。该研究由Georgios Tsaousoglou撰写,将战略性竞价建模为一个重复博弈,并使用多智能体强化学习来模拟代理行为。研究结果表明,人工智能代理可以学会维持超竞争性结果,即使没有明确的指示,也表现出默示串通的迹象。
-
新框架利用人工智能模拟认知智能货运走廊
研究人员开发了一个新的基于代理的建模框架,该框架集成了强化学习和多智能体强化学习来模拟认知智能货运走廊。该框架旨在通过实现车队编队和充电协调的自适应决策来改进联网和自动驾驶汽车(CAVs)的部署。初步结果表明,认知场景提高了吞吐量并减少了拥堵,而辅助场景通过车队编队节省了能源,并且与基于规则的方法相比,MARL协调在充电容量利用率方面更有效。
-
新的pFedMARL方法利用MARL改进非独立同分布数据的联邦学习
研究人员推出了一种新的联邦学习方法pFedMARL,该方法利用多智能体强化学习来应对非独立同分布数据带来的挑战。该方法在聚合过程中动态调整客户端贡献,以增强全局模型的鲁棒性和公平性。该系统在半监督音频频谱图Transformer上进行了测试,与FedAvg和Ditto等标准方法相比,即使存在对抗性客户端,其准确性和弹性也有所提高。
-
AI研究解决GPS欺骗无人机分离问题
研究人员开发了一种新方法,即使在GPS信号降级或被欺骗的情况下,也能确保小型无人机系统(sUAS)之间的分离。该方法利用多智能体强化学习(MARL)为智能体创建了一个鲁棒的对抗策略,将损坏的位置广播视为与对手的零和博弈。该方法推导出了对抗性扰动的闭式表达式,从而能够进行高效计算,并在GPS严重损坏的模拟中展示了接近零的碰撞率。
-
MARL比较研究面临超参数调优挑战
Reddit的r/MachineLearning板块的一位用户正在就多智能体强化学习(MARL)模型的比较研究的超参数调优寻求建议。他们正在各种MARL任务上训练PPO变体,并观察到最佳超参数在不同架构和场景下有所不同。核心问题是是否应统一这些超参数以进行公平比较,同时承认这有时会导致模型不收敛。用户的最终目标是测试这些模型在对抗性攻击下的鲁棒性。
-
新的基于PINN的框架求解复杂HJI方程
研究人员开发了一个新框架,将动态规划与物理信息神经网络(PINNs)相结合,以求解称为Hamilton--Jacobi--Isaacs(HJI)方程的复杂数学方程。该方法旨在处理高维和非凸HJI方程,这些方程在随机微分博弈和鲁棒控制等领域至关重要。所提出的方法在求解线性偏微分方程和使用自动微分更新控制策略之间交替进行,并展示了可证明的稳定性和收敛性。数值实验表明了该方法的准确性和可扩展性,在某些应用中优于直接PINN求解器,并显示出在…
-
新的XAI引导框架优化离线多智能体网络切片
研究人员开发了XAI-CODE,一个新颖的离线多智能体强化学习框架,专为未来6G及更高版本网络的网络切片设计。该方法利用可解释AI来指导去中心化执行,在部署期间无需智能体间通信或环境交互。XAI-CODE旨在最小化每个切片的延迟,同时防止资源冲突,在模拟中显示零冲突,并与现有的在线方法相比显著降低了信令开销和推理延迟。
-
新的MARL方法增强了水下无人机协同目标跟踪能力
两篇新研究论文介绍了用于自主水下航行器(AUV)网络协同目标跟踪的先进多智能体强化学习(MARL)技术。第一篇论文SDA-MARL提出了一种分层架构和一种扩散辅助算法,以解决策略非平稳性、学习效率低下和策略漂移问题。第二篇论文VGG-MADiffRL在分层控制框架内提出了一种价值梯度引导的方法,以克服高维状态-动作建模和对噪声敏感的策略等挑战。两种方法在模拟水下环境中都显示出改进的收敛性、跟踪精度和稳定性。
-
新框架提高机器人多智能体通信效率
研究人员开发了一种新颖的多智能体强化学习系统框架,可在带宽受限的环境中显著提高通信效率。通过整合信息瓶颈理论和矢量量化,该系统学会了压缩和离散化通信消息,同时保留了关键任务信息。该方法包括一个动态机制,根据智能体状态和环境上下文确定通信的必要性。实验表明,在减少带宽使用量的情况下,性能比基线有显著提升,优于现有的通信策略,并为机器人集群和自动驾驶车队等应用提供了理论依据的解决方案。
-
新架构将大型语言模型集成到智能制造的多智能体系统中
一篇新研究论文提出了一个参考架构,用于将大型语言模型(LLM)集成到智能制造的多智能体强化学习(MARL)系统中。该架构将LLM的集成点分为策略、奖励设计、智能体间通信和分层规划。虽然传统的MARL在结构化、实时协调方面表现出色,但LLM在语义解释、奖励生成和较慢的监督规划方面显示出潜力,尽管它们尚未在安全关键控制方面证明等效性。
-
新的MARL框架大幅缩短边缘计算中XR流量延迟
研究人员开发了一种新的多智能体强化学习(MARL)框架,用于改善时间敏感型网络(TSN)环境中的流量调度,特别适用于移动边缘计算(MEC)中的扩展现实(XR)等应用。提出的异构智能体近端策略优化(HAPPO)算法将每个TSN队列建模为一个可以与其他队列协调的独立智能体。该方法旨在解决动态流量条件下静态调度方法的局限性。模拟显示,该MARL框架将平均帧等待时间减少了高达26.8%,最坏情况延迟减少了约16.8%。