新的视觉-语言-动作 (VLA) 模型正在涌现,旨在统一自动驾驶中的感知、推理和控制,从而摆脱传统的模块化堆栈。三个 prominent 模型——来自 UCLA 的 AutoVLA、NVIDIA 的 Alpamayo 系列和 Qwen-Drive-1.0——代表了这种统一的不同方法。AutoVLA 专为边缘部署而设计,具有较少的参数量和基于 token 的动作输出,而 Alpamayo 则是一个较大的、云规模的教师模型,用于蒸馏成较小的运行时模型。 AI
影响 这些统一的 VLA 模型可以简化自动驾驶系统,可能带来更高效、更强大的自动驾驶汽车。
排序理由 文章详细介绍了自动驾驶的新模型及其架构,属于人工智能的研究与开发领域。[lever_c_demoted from research: ic=1 ai=1.0]
- Alpamayo
- Autovla
- Autoware
- CARLA
- Cosmos 3 Super Reasoner
- Cosmos-Reason VLM
- nuPlan
- nuScenes
- NVIDIA
- Qwen2.5-VL-3B
- Qwen3-VL-32B
- Qwen-Drive-1.0
- UCLA
- Waymo E2E Challenge
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →