Bench2drive
PulseAugur coverage of Bench2drive — every cluster mentioning Bench2drive across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新型FIVE-VLA模型提升自动驾驶效率和记忆能力
研究人员开发了FIVE-VLA,这是一种新颖的视觉-语言-动作模型,专为自动驾驶设计,可显著提高效率和时间记忆能力。该模型利用高效的视觉编码器处理高分辨率图像并生成更少的token,并结合了循环动作记忆(RAM)以根据过去的动作来条件化动作预测,这对于复杂机动至关重要。尽管参数量较少,FIVE-VLA在Bench2Drive等基准测试中表现优于先前最先进的模型,并在NVIDIA Physical AI AV数据集上展示了更低的碰撞率,…
-
新的DRiF框架通过数据驱动风险场增强自动驾驶安全性
研究人员开发了一种名为DRiF(数据驱动风险场)的新型框架,以增强端到端自动驾驶系统的安全性。与依赖手工制作的风险函数或占用率派生标签的先前方法不同,DRiF通过将基于规则的安全先验知识转换为成对风险标签来学习风险。这种方法训练风险场以保持相对风险排序,从而在Bench2drive基准测试中提高驾驶得分、成功率并减少碰撞。该框架将静态地图分割、动态风险预测和车辆规划整合到一个共享的鸟瞰图(BEV)特征中。
-
研究发现:自动驾驶模型仅凭记忆即可驾驶
一项新的研究论文探讨了端到端自动驾驶模型的能力,通过仅使用过去驾驶的记忆而不是实时传感器输入来测试其性能。研究发现在 NAVSIM 基准测试中,仅凭记忆几乎足以媲美或超越领先方法的性能,这表明在该基准测试上的高分可能无法准确反映模型对当前交通状况的反应能力。在 Bench2Drive 和 RealEngine 等其他基准测试中,这种影响不太明显,表明在评估动态场景理解方面存在特定基准的局限性。
-
MomADv2框架通过时序记忆提升自动驾驶规划能力
研究人员推出MomADv2,一个旨在增强自动驾驶系统长时域规划能力的新型框架。该新方法通过基于时序和指令一致性选择性过滤历史数据,解决了保持规划连续性的挑战,从而防止过时信息对当前决策产生负面影响。MomADv2还包含一个流匹配轨迹精炼器,用于纠正轨迹偏差并减少长规划时域内的误差累积。实验表明,与先前的方法相比,碰撞率显著降低。
-
新方法通过交通元素感知增强自动驾驶 · 跟踪到2个来源
研究人员开发了一种新颖的可插拔方法,将交通元素感知集成到端到端自动驾驶系统中。该方法系统地研究了交通信号灯和路标的影响,这些元素通常被忽视,而更侧重于动态道路参与者。通过使用结构化的交通元素标注来增强现有数据集,并采用最小集成设计,该方法可以无缝集成到各种驾驶范式中,包括VLA模型和基于扩散的策略。在nuScenes和NAVSIM-v2等多个数据集上的评估表明,驾驶性能得到了一致的提升,在具有挑战性的基准测试中树立了新的最先进水平。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
新的潜在质心引导技术提升自动驾驶模型指令遵循能力
研究人员开发了一种名为潜在质心引导(Latent-Centroid Steering, LCS)的新方法,以改进视觉语言模型(VLMs)在自动驾驶中遵循导航指令的能力。标准的无分类器引导(CFG)对于实时使用可能过于缓慢,因此LCS提供了一种单通道方法,将条件表示引导至预先计算的特定指令质心。该技术将推理延迟降低了约50%,并增强了指令依从性,在Bench2Drive和nuScenes等基准测试中表现出改进的性能。
-
新型扩散模型生成逼真且可控的交通场景,用于自动驾驶
研究人员开发了E2E-CDiff,一个新颖的端到端条件扩散框架,旨在生成逼真且可控的视觉交通场景。该系统对于测试自动驾驶系统至关重要,尤其是在罕见的、对安全至关重要的场景中。E2E-CDiff在条件于前视视觉输入的情况下,联合生成背景车辆的未来运动状态和低级控制。这种方法旨在克服现有方法在平衡可控性与行为逼真性方面存在的局限性。
-
新的VLA框架推动自动驾驶感知和动作规划 · 跟踪9个来源
多篇研究论文介绍了用于自动驾驶的新型框架,这些框架集成了视觉、语言和动作(VLA)能力。MATS提出了一种多模态、多任务学习方法,具有自适应融合和特定任务的专家,用于3D感知。HyWorldVLA结合了像素级监督和基于潜在变量的世界模型以实现鲁棒驾驶,而PerceptDrive则利用冻结的感知模型和自适应专家路由。ForgeDrive使用统一的扩散框架和交叉条件进行视觉-动作生成,MindDrive则采用在线强化学习和大型语言模型进行…
-
新框架为自动驾驶创造更小、更安全的人工智能
研究人员开发了BucketKD,一个旨在为自动驾驶创造更小、更安全端到端运动规划模型的新知识蒸馏框架。该方法将环境变量离散化为自适应分桶,并结合了一个安全感知的航点注意力机制,该机制使用碰撞时间公式来评估风险。在CARLA模拟器中使用Bench2Drive数据集进行的实验表明,BucketKD在规划准确性和安全性方面优于现有方法,同时实现了显著的模型压缩。
-
新研究利用先进的模拟器和基准来解决自动驾驶安全问题
研究人员正在开发新的方法和基准来提高自动驾驶系统的安全性和鲁棒性。其中一种方法 MultiSim 使用模拟器集成来识别在不同模拟环境中都一致的导致故障的场景,其表现优于单一模拟器测试。另一项开发 Shift & Drift 是一个基准,旨在测试运动规划器在语义偏移和执行扰动下的表现,揭示了模仿保真度和韧性之间的权衡。此外,WCog-VLA 是一个结合了世界认知和生成模型以实现主动自动驾驶的新颖框架,而 CARLA-GS 通过解耦表示、…
-
UNIVERSE模型统一了自动驾驶的视频预测和轨迹生成
研究人员推出 UNIVERSE,这是一种用于自动驾驶的新型统一模型,集成了未来视频预测和轨迹生成。与之前使用独立架构的方法不同,UNIVERSE 采用单一的掩码调制 Diffusion Transformer 来共同训练视频潜在表示和轨迹 token,从而允许通过视频学习的动力学直接监督轨迹去噪。这种统一的方法增强了跨域动作泛化能力,并实现了 4.3 倍加速的仅轨迹推理,同时保持了规划精度。
-
DriveVA 模型通过联合视频和动作预测增强自动驾驶泛化能力
研究人员开发了 DriveVA,这是一种新颖的自动驾驶世界模型,旨在提高在不同数据集和传感器配置下的泛化能力。该模型在共享的潜在生成过程中联合预测未来的视觉预测和动作序列,并利用了大规模视频生成模型的先验知识。与现有的最先进方法相比,DriveVA 在 nuScenes 和 Bench2Drive 等基准测试中展示了强大的零样本能力和跨域泛化能力,显著降低了错误率和碰撞事故率。
-
GraphPilot 通过场景图增强自动驾驶性能 · arXiv
研究人员开发了 GraphPilot,一种通过结构化场景图进行条件化来改进基于语言的自动驾驶模型的新方法。该方法显式编码了关系依赖和空间结构,带来了显著的性能提升。在 LangAuto 和 Bench2Drive 基准上的评估表明,与 LMDrive、BEVDriver 和 SimLingo 等现有基线相比,驾驶得分有了实质性提高。该方法允许各种架构有效内化关系先验,即使在测试期间不需要场景图输入。
-
DIVER框架使用强化扩散模型实现多样化的自动驾驶轨迹
研究人员开发了DIVER,一个结合了强化学习和扩散模型的新型端到端自动驾驶框架。该方法旨在克服传统模仿学习的局限性,后者通常会导致保守的驾驶行为。DIVER通过条件化地图元素和周围的代理来生成多样化且可行的轨迹,并使用强化学习来强制执行安全性和多样性约束。
-
新型自动驾驶模型CogAD模仿人类认知
研究人员推出CogAD,这是一种新颖的端到端自动驾驶模型,旨在模仿人类在感知和规划中的认知过程。该模型采用双重分层机制进行上下文处理和意图条件轨迹生成。CogAD在复杂驾驶场景和泛化能力方面表现出色,在nuScenes和Bench2Drive等基准测试中优于现有方法。
-
DriveStack-VLA通过空间智能和自我批评增强驾驶模型
研究人员推出DriveStack-VLA,一个旨在增强视觉-语言-动作驾驶模型空间智能的新框架。该系统利用大型视觉-语言模型骨干,并通过DeepStack风格的连接引入鸟瞰图表示。为了改善感知焦点,它采用渲染教师对齐,对齐真实和栅格化图像感知。DriveStack-VLA还包含一个用于优化轨迹选择的自我批评模块,在NAVSIMv1、NAVSIMv2和Bench2Drive等基准测试中取得了强劲的性能。
-
新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源
近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…
-
GraphBEV++框架解决了自动驾驶感知中的特征不对齐问题
研究人员推出了GraphBEV++,一个旨在解决自动驾驶系统鸟瞰图(BEV)感知中特征不对齐问题的新型框架。该框架包含两个主要模块:LocalAlign-v2,它使用图匹配来处理邻域感知的深度特征,以纠正局部不对齐;以及GlobalAlign-v2,它提供可变形和扩散变体来解决全局不对齐问题。GraphBEV++在nuScenes和Waymo等数据集上展示了最先进的性能,在感知、预测和规划任务中提高了准确性和鲁棒性,即使在校准不确定性下也是如此。
-
新的AI模型应对自动驾驶的远期规划问题
研究人员正在开发先进的自动驾驶AI模型,重点是改进轨迹规划和远期决策。包括ParkingTransformer、TerraTransfer、AlignDrive、Metis和GraphWorld在内的几个新框架,利用了LLM、自我博弈和基于图的世界建模等技术,以增强复杂驾驶场景下的泛化性、效率和安全性。这些方法旨在通过更好地整合感知、预测和规划,以及从多样化数据中学习而不完全依赖专家演示,来克服现有方法的局限性。