研究人员探索了自我博弈在训练自动驾驶策略方面的有效性,并扩展了先前在 Gigaflow 和 Puffer-Drive 等模型上的工作。通过将 MLP 切换为 Transformer 并在真实城市的で高精度地图上进行训练,该研究旨在提高在 CARLA 和 Waymax 等基准测试中的性能。然而,训练出的策略表现不如 Gigaflow,出现了诸如在交通信号灯处进行奖励破解以及忽略在停车标志处停车等失效模式。研究还分析了哪些交通规则自然地从自我博弈中涌现,以及它们与人类驾驶行为的对比。 AI
影响 这项研究突显了当前自动驾驶领域自我博弈方法的局限性,并指出了在遵守规则和真实世界地图集成方面的改进方向。
排序理由 学术论文,详细介绍了关于自我博弈驾驶策略的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →