研究人员开发了HORIZON,一种专为Lux AI第三赛季竞赛设计的层级智能体,该竞赛要求在部分可观察的多智能体导航场景中进行适应。该智能体采用多方面方法,包括空间感知、信念跟踪、图注意力以及探索策略,将短期控制与长期推理分开。HORIZON使用JAX模拟器中的Proximal Policy Optimization进行训练,与现有基线相比,在胜率和适应能力方面均有显著提升。 AI
影响 这项研究为复杂、部分可观察环境中的智能体适应引入了先进技术,可能影响未来的多智能体系统开发。
排序理由 详细介绍新智能体架构及其在特定基准上性能的学术论文。[lever_c_research降级:ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →