Bench2drive
PulseAugur coverage of Bench2drive — every cluster mentioning Bench2drive across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新方法通过交通元素感知增强自动驾驶 · 跟踪到2个来源
研究人员开发了一种新颖的可插拔方法,将交通元素感知集成到端到端自动驾驶系统中。该方法系统地研究了交通信号灯和路标的影响,这些元素通常被忽视,而更侧重于动态道路参与者。通过使用结构化的交通元素标注来增强现有数据集,并采用最小集成设计,该方法可以无缝集成到各种驾驶范式中,包括VLA模型和基于扩散的策略。在nuScenes和NAVSIM-v2等多个数据集上的评估表明,驾驶性能得到了一致的提升,在具有挑战性的基准测试中树立了新的最先进水平。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
新的潜在质心引导技术提升自动驾驶模型指令遵循能力
研究人员开发了一种名为潜在质心引导(Latent-Centroid Steering, LCS)的新方法,以改进视觉语言模型(VLMs)在自动驾驶中遵循导航指令的能力。标准的无分类器引导(CFG)对于实时使用可能过于缓慢,因此LCS提供了一种单通道方法,将条件表示引导至预先计算的特定指令质心。该技术将推理延迟降低了约50%,并增强了指令依从性,在Bench2Drive和nuScenes等基准测试中表现出改进的性能。
-
新型扩散模型生成逼真且可控的交通场景,用于自动驾驶
研究人员开发了E2E-CDiff,一个新颖的端到端条件扩散框架,旨在生成逼真且可控的视觉交通场景。该系统对于测试自动驾驶系统至关重要,尤其是在罕见的、对安全至关重要的场景中。E2E-CDiff在条件于前视视觉输入的情况下,联合生成背景车辆的未来运动状态和低级控制。这种方法旨在克服现有方法在平衡可控性与行为逼真性方面存在的局限性。
-
新的VLA框架推动自动驾驶感知和动作规划 · 跟踪9个来源
多篇研究论文介绍了用于自动驾驶的新型框架,这些框架集成了视觉、语言和动作(VLA)能力。MATS提出了一种多模态、多任务学习方法,具有自适应融合和特定任务的专家,用于3D感知。HyWorldVLA结合了像素级监督和基于潜在变量的世界模型以实现鲁棒驾驶,而PerceptDrive则利用冻结的感知模型和自适应专家路由。ForgeDrive使用统一的扩散框架和交叉条件进行视觉-动作生成,MindDrive则采用在线强化学习和大型语言模型进行…
-
新框架为自动驾驶创造更小、更安全的人工智能
研究人员开发了BucketKD,一个旨在为自动驾驶创造更小、更安全端到端运动规划模型的新知识蒸馏框架。该方法将环境变量离散化为自适应分桶,并结合了一个安全感知的航点注意力机制,该机制使用碰撞时间公式来评估风险。在CARLA模拟器中使用Bench2Drive数据集进行的实验表明,BucketKD在规划准确性和安全性方面优于现有方法,同时实现了显著的模型压缩。
-
新研究利用先进的模拟器和基准来解决自动驾驶安全问题
研究人员正在开发新的方法和基准来提高自动驾驶系统的安全性和鲁棒性。其中一种方法 MultiSim 使用模拟器集成来识别在不同模拟环境中都一致的导致故障的场景,其表现优于单一模拟器测试。另一项开发 Shift & Drift 是一个基准,旨在测试运动规划器在语义偏移和执行扰动下的表现,揭示了模仿保真度和韧性之间的权衡。此外,WCog-VLA 是一个结合了世界认知和生成模型以实现主动自动驾驶的新颖框架,而 CARLA-GS 通过解耦表示、…
-
UNIVERSE模型统一了自动驾驶的视频预测和轨迹生成
研究人员推出 UNIVERSE,这是一种用于自动驾驶的新型统一模型,集成了未来视频预测和轨迹生成。与之前使用独立架构的方法不同,UNIVERSE 采用单一的掩码调制 Diffusion Transformer 来共同训练视频潜在表示和轨迹 token,从而允许通过视频学习的动力学直接监督轨迹去噪。这种统一的方法增强了跨域动作泛化能力,并实现了 4.3 倍加速的仅轨迹推理,同时保持了规划精度。
-
DriveVA 模型通过联合视频和动作预测增强自动驾驶泛化能力
研究人员开发了 DriveVA,这是一种新颖的自动驾驶世界模型,旨在提高在不同数据集和传感器配置下的泛化能力。该模型在共享的潜在生成过程中联合预测未来的视觉预测和动作序列,并利用了大规模视频生成模型的先验知识。与现有的最先进方法相比,DriveVA 在 nuScenes 和 Bench2Drive 等基准测试中展示了强大的零样本能力和跨域泛化能力,显著降低了错误率和碰撞事故率。
-
GraphPilot 通过场景图增强自动驾驶性能 · arXiv
研究人员开发了 GraphPilot,一种通过结构化场景图进行条件化来改进基于语言的自动驾驶模型的新方法。该方法显式编码了关系依赖和空间结构,带来了显著的性能提升。在 LangAuto 和 Bench2Drive 基准上的评估表明,与 LMDrive、BEVDriver 和 SimLingo 等现有基线相比,驾驶得分有了实质性提高。该方法允许各种架构有效内化关系先验,即使在测试期间不需要场景图输入。
-
DIVER框架使用强化扩散模型实现多样化的自动驾驶轨迹
研究人员开发了DIVER,一个结合了强化学习和扩散模型的新型端到端自动驾驶框架。该方法旨在克服传统模仿学习的局限性,后者通常会导致保守的驾驶行为。DIVER通过条件化地图元素和周围的代理来生成多样化且可行的轨迹,并使用强化学习来强制执行安全性和多样性约束。
-
新型自动驾驶模型CogAD模仿人类认知
研究人员推出CogAD,这是一种新颖的端到端自动驾驶模型,旨在模仿人类在感知和规划中的认知过程。该模型采用双重分层机制进行上下文处理和意图条件轨迹生成。CogAD在复杂驾驶场景和泛化能力方面表现出色,在nuScenes和Bench2Drive等基准测试中优于现有方法。
-
DriveStack-VLA通过空间智能和自我批评增强驾驶模型
研究人员推出DriveStack-VLA,一个旨在增强视觉-语言-动作驾驶模型空间智能的新框架。该系统利用大型视觉-语言模型骨干,并通过DeepStack风格的连接引入鸟瞰图表示。为了改善感知焦点,它采用渲染教师对齐,对齐真实和栅格化图像感知。DriveStack-VLA还包含一个用于优化轨迹选择的自我批评模块,在NAVSIMv1、NAVSIMv2和Bench2Drive等基准测试中取得了强劲的性能。
-
新研究增强了用于医疗、检索和机器人任务的视觉-语言模型
研究人员正在开发新方法来改进各种领域的视觉-语言模型(VLM)。一篇论文介绍了CoT-Mediate,一个用于评估生成推理如何影响VLM在医疗情境下预测的框架,发现推理的位置比其声明的来源更关键。另一项研究提出了ReToken,一个可学习的单一嵌入,通过选择相关的视觉标记来增强视觉检索,在Visual Haystacks和LVBench等基准测试中显示出显著的提升。对于机器人领域,BioVLN是一个专为生物医学实验室视觉-语言导航设计…
-
GraphBEV++框架解决了自动驾驶感知中的特征不对齐问题
研究人员推出了GraphBEV++,一个旨在解决自动驾驶系统鸟瞰图(BEV)感知中特征不对齐问题的新型框架。该框架包含两个主要模块:LocalAlign-v2,它使用图匹配来处理邻域感知的深度特征,以纠正局部不对齐;以及GlobalAlign-v2,它提供可变形和扩散变体来解决全局不对齐问题。GraphBEV++在nuScenes和Waymo等数据集上展示了最先进的性能,在感知、预测和规划任务中提高了准确性和鲁棒性,即使在校准不确定性下也是如此。
-
新的AI模型应对自动驾驶的远期规划问题
研究人员正在开发先进的自动驾驶AI模型,重点是改进轨迹规划和远期决策。包括ParkingTransformer、TerraTransfer、AlignDrive、Metis和GraphWorld在内的几个新框架,利用了LLM、自我博弈和基于图的世界建模等技术,以增强复杂驾驶场景下的泛化性、效率和安全性。这些方法旨在通过更好地整合感知、预测和规划,以及从多样化数据中学习而不完全依赖专家演示,来克服现有方法的局限性。
-
PersonaDrive管道为模拟创建类人驾驶代理
研究人员开发了PersonaDrive,这是一个用于在闭环驾驶模拟中创建更像人类的非自我交通代理的新型管道。该系统将视觉-语言-动作(VLA)代理与从人类被指示以特定风格(激进、中立、保守)驾驶的数据集中检索到的驾驶演示相结合。该管道有效地融合了视觉特征和控制信号,并微调了VLA骨干网络,以使用这些检索到的上下文作为行为演示,从而无需为每种风格进行重新训练即可实现风格多样的代理。
-
发布新的自动驾驶数据集和多模态动作模型
研究人员推出了 KITScenes Multimodal,一个用于自动驾驶的新欧洲数据集,该数据集具有高保真传感器和全面的高清地图。该数据集旨在解决现有数据集在传感器保真度、地图完整性和地理多样性方面的局限性。此外,还开发了一个名为 Action Diffusion Transformer (ADT) 的新模型,用于端到端自动驾驶,该模型利用多模态动作预测来提高性能和稳定性。
-
新基准和模型提升了自动驾驶的视觉语言模型能力
研究人员正在开发新的基准和模型,以提高视觉语言模型(VLMs)在自动驾驶中的能力。Drive-P2D 和 DriveSpatial 是新的基准,分别用于评估 VLM 在渐进式感知到决策任务和时空推理方面的能力,突显了当前场景构建和推理的局限性。同时,Fast-dDrive、SparseWorld 和 SpaceDrive 提出了新颖的 VLM 架构和方法,例如块扩散和空间感知注入,通过更好地平衡感知、规划和实时部署需求,来提高自动驾驶…
-
DeepSight模型通过远期世界建模增强自动驾驶能力
研究人员开发了DeepSight,一种用于端到端自动驾驶系统的新型世界模型,通过在鸟瞰图(BEV)空间中预测未来状态来增强决策能力。该模型集成了视觉-语言模型(VLM)架构和一个专为驾驶场景设计的特殊视觉推理模块。DeepSight还包含一个自适应文本推理机制,该机制利用社会知识来提高在具有挑战性的长尾情况下的性能,并在Bench2drive基准测试中取得了最先进的成果。