NAVSIM
PulseAugur coverage of NAVSIM — every cluster mentioning NAVSIM across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
RISE框架通过自适应想象和新的反事实数据集优化AI规划
研究人员开发了RISE,一个用于世界动作模型(WAMs)的自适应想象框架,通过对是否继续或停止未来世界演化模拟进行顺序决策来优化规划。该系统旨在通过权衡持续想象的预期收益与计算成本来提高规划效率。为了解决现有数据集的局限性,创建了一个名为CounterDrive的新反事实数据集,为训练和监督提供多样化的结果和风险水平,特别适用于安全关键型应用。在NAVSIM和nuScenes上的实验表明,RISE在提高规划性能的同时减少了不必要的模拟…
-
新WA-JEPA模型推动自动驾驶规划发展
研究人员开发了WA-JEPA,一种用于自动驾驶规划的新型世界-动作模型,它改进了视频联合嵌入预测架构(V-JEPA)范式。与之前使用随机掩码和确定性回归的V-JEPA模型不同,WA-JEPA采用了混合未来掩码预训练和条件流匹配,以实现更有效的未来预测。这种方法允许联合未来-动作预测,直接塑造与规划相关的世界表征,并在NAVSIM和HUGSIM等基准测试中取得了最先进的成果。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
NAVSIM v2.2 防御性驾驶分数因数值不稳定性而受损
对NAVSIM v2.2防御性驾驶评估系统的一项新审计揭示了关键的数值不稳定性。这种不稳定性可能导致记录的人类参考数据出现故障,并广泛影响代理商的合规性评分,从而削弱了分数的有效性。研究人员发现,数值后端中共享的速度重拟是导致此问题的直接诱因。他们提出了一项审计协议,包括分数基础披露、盲测和回放稳定性测试,以确保防御性驾驶声明的可靠性。
-
新研究探讨视觉语言模型与纯视觉模型在自动驾驶中的应用
研究人员开发了一种新的端到端驾驶系统方法,通过比较视觉语言模型(VLMs)和传统的纯视觉编码器。他们的研究发现,尽管两种模型在策略学习后共享显著的表征重叠,但它们保留了影响驾驶行为的独特残差因素。纯视觉模型在更简单、侧重几何的任务中表现出色,而视觉语言模型在复杂、长尾场景中表现更好。该研究提出了混合和双系统架构,利用两者的互补优势,从而提高驾驶模拟的准确性和效率。
-
新的自动驾驶规划器使用结构化场景知识和自适应推理
研究人员为自动驾驶开发了一种新颖的认知双过程规划框架,该框架利用结构化场景知识和可验证的推理-行动一致性。该框架使用机器可解析的思维链模式来表示与规划相关的信息,这些信息无需手动注释即可自动生成。自适应推理系统根据估计的场景复杂性,将场景路由到快速的元动作预测或较慢、更详细的结构化推理,并通过基于规则的验证确保推理和行动之间的一致性。
-
新方法提升扩散策略训练和推理速度
研究人员开发了新方法来提高扩散策略(一种因其在决策任务中的应用而日益普及的AI模型)的效率和稳定性。一种名为DIPOLE的方法引入了一种新颖的强化学习算法,该算法将策略分解为最大化奖励和最小化奖励的组成部分,从而实现稳定的训练和可控的动作生成。另一种名为Evolving Cache Schedules (EVO) 的方法则利用进化搜索来优化推理过程中的缓存重用,在不重新训练扩散策略的情况下显著加快动作生成速度并降低计算成本。
-
UNIVERSE模型统一了自动驾驶的视频预测和轨迹生成
研究人员推出 UNIVERSE,这是一种用于自动驾驶的新型统一模型,集成了未来视频预测和轨迹生成。与之前使用独立架构的方法不同,UNIVERSE 采用单一的掩码调制 Diffusion Transformer 来共同训练视频潜在表示和轨迹 token,从而允许通过视频学习的动力学直接监督轨迹去噪。这种统一的方法增强了跨域动作泛化能力,并实现了 4.3 倍加速的仅轨迹推理,同时保持了规划精度。
-
Drive-JEPA框架通过新颖的视频预训练推动端到端自动驾驶发展
研究人员推出Drive-JEPA,一个结合视频联合嵌入预测架构(V-JEPA)和多模态轨迹蒸馏的端到端自动驾驶新框架。该方法将V-JEPA应用于海量驾驶视频的ViT编码器预训练,生成对轨迹规划至关重要的预测表示。该系统还包含一个以提案为中心的规划器,它蒸馏各种模拟器生成和人类轨迹,并使用动量感知选择机制来确保稳定和安全的驾驶行为。在NAVSIM基准测试中,Drive-JEPA取得了新的最先进成果。
-
DriveVA 模型通过联合视频和动作预测增强自动驾驶泛化能力
研究人员开发了 DriveVA,这是一种新颖的自动驾驶世界模型,旨在提高在不同数据集和传感器配置下的泛化能力。该模型在共享的潜在生成过程中联合预测未来的视觉预测和动作序列,并利用了大规模视频生成模型的先验知识。与现有的最先进方法相比,DriveVA 在 nuScenes 和 Bench2Drive 等基准测试中展示了强大的零样本能力和跨域泛化能力,显著降低了错误率和碰撞事故率。
-
新的自动驾驶模型使用世界模型进行更安全、更鲁棒的规划 · 跟踪 2 个来源
两篇新的研究论文介绍了用于端到端自动驾驶的先进世界建模技术。OWMDrive 专注于 4D 占用世界模型,用于多步 3D 占用预测,以指导基于扩散的规划,旨在实现更具前瞻性和鲁棒性的轨迹生成,尤其是在挑战性场景中。ExploreVLA 将世界建模与强化学习相结合,以实现超越专家演示的策略探索,使用未来图像生成作为密集世界建模目标和新颖性检测的内在奖励信号。
-
DIVER框架使用强化扩散模型实现多样化的自动驾驶轨迹
研究人员开发了DIVER,一个结合了强化学习和扩散模型的新型端到端自动驾驶框架。该方法旨在克服传统模仿学习的局限性,后者通常会导致保守的驾驶行为。DIVER通过条件化地图元素和周围的代理来生成多样化且可行的轨迹,并使用强化学习来强制执行安全性和多样性约束。
-
新研究推进自动驾驶和机器人领域的世界行动模型
两篇新研究论文介绍了世界行动模型(WAMs)的先进方法,这对于模拟未来环境变化和规划行动至关重要,尤其是在自动驾驶和机器人领域。第一篇论文 ReWorld 专注于通过直接优化中间表示来改进 WAMs 中的表示学习,以实现更好的视频生成和规划。第二篇论文 DIM-WAM 通过整合多样化的历史事件记忆来增强 WAMs,以处理长时任务,显著提高了机器人操作场景下的性能。
-
新的ASSCG系统优化了LLM在自动驾驶规划中的使用
研究人员开发了一个名为ASSCG的新系统,用于优化大型语言模型(LLM)在自动驾驶规划中的使用。ASSCG充当守门员,做出帧级决策来刷新、重用或抑制慢速LLM的指导,从而降低计算成本并提高效率。当应用于现有的快慢规划架构时,ASSCG在性能指标和推理延迟降低方面均表现出显著的改进。
-
GraphBEV++框架解决了自动驾驶感知中的特征不对齐问题
研究人员推出了GraphBEV++,一个旨在解决自动驾驶系统鸟瞰图(BEV)感知中特征不对齐问题的新型框架。该框架包含两个主要模块:LocalAlign-v2,它使用图匹配来处理邻域感知的深度特征,以纠正局部不对齐;以及GlobalAlign-v2,它提供可变形和扩散变体来解决全局不对齐问题。GraphBEV++在nuScenes和Waymo等数据集上展示了最先进的性能,在感知、预测和规划任务中提高了准确性和鲁棒性,即使在校准不确定性下也是如此。
-
新的AI模型应对自动驾驶的远期规划问题
研究人员正在开发先进的自动驾驶AI模型,重点是改进轨迹规划和远期决策。包括ParkingTransformer、TerraTransfer、AlignDrive、Metis和GraphWorld在内的几个新框架,利用了LLM、自我博弈和基于图的世界建模等技术,以增强复杂驾驶场景下的泛化性、效率和安全性。这些方法旨在通过更好地整合感知、预测和规划,以及从多样化数据中学习而不完全依赖专家演示,来克服现有方法的局限性。
-
新型分词器改进自动驾驶决策AI
研究人员开发了一种新的离散分词器,旨在改进自动驾驶系统处理视觉信息的方式。该分词器同时受到特征表示和几何数据的指导,目标是创建比仅为图像生成优化的分词器更有利于决策的分词。通过联合监督分词器的特征解码和RGB重建,并结合深度和姿态信息,该系统展现出更高的保真度和一致性。学习到的分词器在规划任务中表现出有竞争力的性能,并在与世界模型一起使用时提高了生成质量。
-
新数据集和AI方法推动自动驾驶研究进展
研究人员提出了几种增强自动驾驶系统的新方法。一篇论文详细介绍了TaCarla,这是一个用于端到端自动驾驶研究的大型数据集,包含超过285万帧,并支持检测和预测等各种任务。另一项研究提出了扩散强制规划器(DFP),这是一个基于扩散的框架,旨在提高运动计划的时间一致性和稳定性。此外,一种名为不确定性感知运动规划(UAMP)的新方法旨在通过考虑人类驾驶员意图的不确定性来提高混合交通环境中的安全性和舒适性。
-
NTR框架增强了自动驾驶的场景令牌瓶颈
研究人员开发了神经令牌重建(NTR),一个旨在改善端到端自动驾驶系统场景令牌瓶颈的新框架。NTR使用自蒸馏掩码潜在重建目标,以确保紧凑的场景令牌保留更丰富的视觉信息用于规划。该方法在推理时移除辅助组件,在Waymo E2E和NavSim等多个自动驾驶基准测试中取得了最先进的成果。
-
DriveWAM模型将视频扩散模型应用于自动驾驶
研究人员开发了DriveWAM,一个用于自动驾驶的新模型,它改编了预训练的视频扩散Transformer。该模型将视频和动作流整合到单个序列中,利用视频生成的时序动态和运动先验。DriveWAM还整合了来自冻结的视觉语言模型的场景理解,并使用选择性记忆来保持长时规划能力。在基准数据集上的实验表明,其规划性能强大,并且随着数据量的增加具有可扩展性。