研究人员开发了一种逐批次多智能体强化学习方法,用于多式联运货运路由,专门解决飓风等事件造成的干扰。他们采用集中式训练、分布式执行的独立PPO(IPPO)方法,在一个包含15个枢纽的网络上与启发式基线进行了比较。虽然IPPO在吞吐量和交付率方面有所提高,但在高需求下,具有容量感知的启发式方法在韧性和延迟指标方面表现更佳。 AI
影响 引入了一种新颖的多智能体强化学习方法,用于在极端天气干扰下优化货运路由。
排序理由 学术论文,详细介绍了多智能体强化学习在特定问题领域的创新应用。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Dec-POMDP
- Hawker Hurricane
- Hugging Face
- Independent PPO
- Multi-Agent PPO
- Proximal Policy Optimization
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →