NAVSIM
PulseAugur coverage of NAVSIM — every cluster mentioning NAVSIM across labs, papers, and developer communities, ranked by signal.
- developed World-Action Models 90%
- used by alphaXiv 80%
- instance of Bench2drive 70%
- used by World-Action Models 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- used by Gotit.pub 70%
- used by nuscenes-devkit 70%
- instance of Carla 70%
- instance of Nuscenes 60%
- used by Carla 60%
- competes with Nuscenes 50%
2 天有情绪数据
-
新研究探索用于自动驾驶安全与规划的高级AI · 追踪10个来源
arXiv上发表的多篇研究论文探讨了自动驾驶系统的先进技术,重点是改进规划、预测和安全。其中一篇论文介绍了一个分层评估协议,用于评估生成场景模型的物理一致性,揭示了标准指标未显现的局限性。另一篇论文提出了Diffusion-2BC,一种用于离线行为克隆的混合扩散和回归训练方法,可提高闭环性能。此外,对规则对齐扩散规划器(RADP)的研究旨在将驾驶规则直接纳入扩散模型,以提高可解释性和安全性,同时正在开发Meta-多智能体强化学习(me…
-
新GRAVA框架增强自动驾驶AI推理与行动
研究人员推出GRAVA,一个用于自动驾驶的新框架,增强了视觉-语言-行动(VLA)模型的推理和行动方式。GRAVA的核心创新在于其基于推理到行动(GRA)的方法,该方法将语言参考与视觉场景证据和物理状态紧密联系起来,在一个结构化图中组织决策,然后生成可执行的行动。该框架包括一个数据构建管道和一个渐进式训练策略,在NAVSIM和内部长尾数据集等基准测试中取得了改进的性能。
-
新方法将轨迹规划集成到视觉语言模型中
研究人员开发了DiffAdapterVLA,一种将连续轨迹生成直接集成到视觉语言模型(VLM)骨干网络中的新方法。该方法将显式轨迹令牌注入选定的VLM层,使轨迹状态能够与不同深度的驾驶条件共同演变。通过递归地优化轨迹生成并使用非对称联合注意力,DiffAdapterVLA使现有的VLM能够以低延迟和最少的训练参数实现高效的连续规划能力,这在NAVSIM模拟中得到了证明。
-
新的自动驾驶世界模型增强了预测和动作生成能力
三篇新的研究论文介绍了先进的自动驾驶世界模型,重点在于改进预测和动作生成。Drive-HWM 利用具有动态感知潜在变量的分层慢-快框架,实现长时程预测和响应式决策。SV-WAM 提出了一种高效的环视模型,该模型使用未来视频预测进行训练监督,从而在推理时实现高效的仅动作规划。LaPla 通过对齐潜在空间,弥合了离散推理与连续动作之间的差距,确保了物理上可行的轨迹并减少了量化误差。
-
新数据集增强了自动驾驶的轨迹评分
研究人员开发了一个新的训练数据集,旨在提高自动驾驶系统中学习型轨迹评分模型的性能。该数据集通过生成从记录的人类轨迹中横向和纵向扰动的样本,提供更具信息量的监督。当应用于连接到 DiffusionDrive 和 MeanFuser 等冻结生成规划器的基于 Transformer 的评分器时,新数据集在 NAVSIM navtrain 数据集上展示了改进的结果。
-
研究发现:自动驾驶模型仅凭记忆即可驾驶
一项新的研究论文探讨了端到端自动驾驶模型的能力,通过仅使用过去驾驶的记忆而不是实时传感器输入来测试其性能。研究发现在 NAVSIM 基准测试中,仅凭记忆几乎足以媲美或超越领先方法的性能,这表明在该基准测试上的高分可能无法准确反映模型对当前交通状况的反应能力。在 Bench2Drive 和 RealEngine 等其他基准测试中,这种影响不太明显,表明在评估动态场景理解方面存在特定基准的局限性。
-
MomADv2框架通过时序记忆提升自动驾驶规划能力
研究人员推出MomADv2,一个旨在增强自动驾驶系统长时域规划能力的新型框架。该新方法通过基于时序和指令一致性选择性过滤历史数据,解决了保持规划连续性的挑战,从而防止过时信息对当前决策产生负面影响。MomADv2还包含一个流匹配轨迹精炼器,用于纠正轨迹偏差并减少长规划时域内的误差累积。实验表明,与先前的方法相比,碰撞率显著降低。
-
新的自动驾驶模型预测未来世界状态和动作 · 已追踪 2 个来源
研究人员开发了新的自动驾驶模型,专注于预测未来的世界状态和动作。WA-JEPA 模型(在一篇论文中提出)通过使用混合未来掩码预训练和条件流匹配来进行潜在未来预测,从而改进了视频联合嵌入预测架构(V-JEPA),并在 NAVSIM 和 HUGSIM 基准测试中取得了优异成绩。另一个模型 GeoWAM 强调使用点云等几何表示而非基于像素的方法,认为几何形状更能自然地捕捉驾驶动态并与动作执行保持一致,在开放循环和闭环评估中均表现出卓越的性能。
-
新的世界动作模型增强了游戏和机器人中的AI代理
研究人员正在开发新颖的世界动作模型(WAM),以提高AI代理在视频游戏和机器人中的性能。例如,GameWAM统一了视觉预测和动作生成,以实现原生的游戏控制,并以更少的动作展示了具有竞争力的结果。其他进展包括LAWA,它使用潜在动作在机器人中进行高效的未来想象;RISE,一个优化规划想象展开的自适应框架;4DGS-WAM利用4D高斯溅射进行以对象为中心的建模;以及GlanceWAM,它将想象与控制分离以实现实时推理。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
NAVSIM v2.2 防御性驾驶分数因数值不稳定性而受损
对NAVSIM v2.2防御性驾驶评估系统的一项新审计揭示了关键的数值不稳定性。这种不稳定性可能导致记录的人类参考数据出现故障,并广泛影响代理商的合规性评分,从而削弱了分数的有效性。研究人员发现,数值后端中共享的速度重拟是导致此问题的直接诱因。他们提出了一项审计协议,包括分数基础披露、盲测和回放稳定性测试,以确保防御性驾驶声明的可靠性。
-
新研究探讨视觉语言模型与纯视觉模型在自动驾驶中的应用
研究人员开发了一种新的端到端驾驶系统方法,通过比较视觉语言模型(VLMs)和传统的纯视觉编码器。他们的研究发现,尽管两种模型在策略学习后共享显著的表征重叠,但它们保留了影响驾驶行为的独特残差因素。纯视觉模型在更简单、侧重几何的任务中表现出色,而视觉语言模型在复杂、长尾场景中表现更好。该研究提出了混合和双系统架构,利用两者的互补优势,从而提高驾驶模拟的准确性和效率。
-
新的自动驾驶规划器使用结构化场景知识和自适应推理
研究人员为自动驾驶开发了一种新颖的认知双过程规划框架,该框架利用结构化场景知识和可验证的推理-行动一致性。该框架使用机器可解析的思维链模式来表示与规划相关的信息,这些信息无需手动注释即可自动生成。自适应推理系统根据估计的场景复杂性,将场景路由到快速的元动作预测或较慢、更详细的结构化推理,并通过基于规则的验证确保推理和行动之间的一致性。
-
新方法提升扩散策略训练和推理速度
研究人员开发了新方法来提高扩散策略(一种因其在决策任务中的应用而日益普及的AI模型)的效率和稳定性。一种名为DIPOLE的方法引入了一种新颖的强化学习算法,该算法将策略分解为最大化奖励和最小化奖励的组成部分,从而实现稳定的训练和可控的动作生成。另一种名为Evolving Cache Schedules (EVO) 的方法则利用进化搜索来优化推理过程中的缓存重用,在不重新训练扩散策略的情况下显著加快动作生成速度并降低计算成本。
-
UNIVERSE模型统一了自动驾驶的视频预测和轨迹生成
研究人员推出 UNIVERSE,这是一种用于自动驾驶的新型统一模型,集成了未来视频预测和轨迹生成。与之前使用独立架构的方法不同,UNIVERSE 采用单一的掩码调制 Diffusion Transformer 来共同训练视频潜在表示和轨迹 token,从而允许通过视频学习的动力学直接监督轨迹去噪。这种统一的方法增强了跨域动作泛化能力,并实现了 4.3 倍加速的仅轨迹推理,同时保持了规划精度。
-
Drive-JEPA框架通过新颖的视频预训练推动端到端自动驾驶发展
研究人员推出Drive-JEPA,一个结合视频联合嵌入预测架构(V-JEPA)和多模态轨迹蒸馏的端到端自动驾驶新框架。该方法将V-JEPA应用于海量驾驶视频的ViT编码器预训练,生成对轨迹规划至关重要的预测表示。该系统还包含一个以提案为中心的规划器,它蒸馏各种模拟器生成和人类轨迹,并使用动量感知选择机制来确保稳定和安全的驾驶行为。在NAVSIM基准测试中,Drive-JEPA取得了新的最先进成果。
-
DriveVA 模型通过联合视频和动作预测增强自动驾驶泛化能力
研究人员开发了 DriveVA,这是一种新颖的自动驾驶世界模型,旨在提高在不同数据集和传感器配置下的泛化能力。该模型在共享的潜在生成过程中联合预测未来的视觉预测和动作序列,并利用了大规模视频生成模型的先验知识。与现有的最先进方法相比,DriveVA 在 nuScenes 和 Bench2Drive 等基准测试中展示了强大的零样本能力和跨域泛化能力,显著降低了错误率和碰撞事故率。
-
新的自动驾驶模型使用世界模型进行更安全、更鲁棒的规划 · 跟踪 2 个来源
两篇新的研究论文介绍了用于端到端自动驾驶的先进世界建模技术。OWMDrive 专注于 4D 占用世界模型,用于多步 3D 占用预测,以指导基于扩散的规划,旨在实现更具前瞻性和鲁棒性的轨迹生成,尤其是在挑战性场景中。ExploreVLA 将世界建模与强化学习相结合,以实现超越专家演示的策略探索,使用未来图像生成作为密集世界建模目标和新颖性检测的内在奖励信号。
-
DIVER框架使用强化扩散模型实现多样化的自动驾驶轨迹
研究人员开发了DIVER,一个结合了强化学习和扩散模型的新型端到端自动驾驶框架。该方法旨在克服传统模仿学习的局限性,后者通常会导致保守的驾驶行为。DIVER通过条件化地图元素和周围的代理来生成多样化且可行的轨迹,并使用强化学习来强制执行安全性和多样性约束。
-
新研究推进自动驾驶和机器人领域的世界行动模型
两篇新研究论文介绍了世界行动模型(WAMs)的先进方法,这对于模拟未来环境变化和规划行动至关重要,尤其是在自动驾驶和机器人领域。第一篇论文 ReWorld 专注于通过直接优化中间表示来改进 WAMs 中的表示学习,以实现更好的视频生成和规划。第二篇论文 DIM-WAM 通过整合多样化的历史事件记忆来增强 WAMs,以处理长时任务,显著提高了机器人操作场景下的性能。