bird's-eye view
PulseAugur coverage of bird's-eye view — every cluster mentioning bird's-eye view across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新模块增强了自动驾驶多模态3D检测的鲁棒性
研究人员开发了一种后融合稳定器(PFS),这是一个轻量级模块,旨在增强自动驾驶中使用的多模态3D检测系统的鲁棒性。该模块作用于中间鸟瞰图(BEV)表示,稳定特征统计并抑制由传感器故障或域偏移引起的退化空间区域。在nuScenes基准上的评估表明,PFS在各种故障模式下(包括摄像头掉线和弱光条件)显著提高了性能,同时保持了最小的参数占用。
-
新的ARC-Loc方法实现了地面到卫星图像的直接本地化
研究人员开发了ARC-Loc,一种新颖的跨视图本地化方法,可以直接将地面图像与卫星图像进行匹配,而无需依赖中间的3D变换或外部深度模型。该技术利用了地面关键点可以映射到卫星地图上汇聚的射线的几何原理,其交点指示用户的位置。这种方法通过方位角射线收敛(ARC)求解器和损失函数进行优化,在保持VIGOR和KITTI等基准数据集上具有竞争力的准确性的同时,提供了更快、更节省内存的推理。
-
Fast-BEV++ 在纯视觉 BEV 感知领域实现最先进的速度和准确性
研究人员开发了 Fast-BEV++,一种新颖的纯视觉鸟瞰图(BEV)感知方法,解决了准确性和效率之间的权衡问题。通过将视图转换算法化为硬件友好的流水线,Fast-BEV++ 在无需自定义内核的情况下实现了超过三倍的现有方法加速。该新方法在 nuScenes 数据集上建立了最先进的平衡,在超过 134 FPS 的速度下达到了 0.488 NDS,并且其架构允许在生产平台上无缝实时部署。
-
GEM模型使用可变形Mamba进行先进的激光雷达世界建模
研究人员开发了GEM,一种用于自动驾驶中基于激光雷达的世界建模的新型生成模型。该模型利用可变形Mamba架构来克服激光雷达点云的无序性和动态与静态物体区分相关的挑战。GEM处理标记化的激光雷达扫描,解耦特征,并采用三路径可变形Mamba以增强时空理解,在各种基准测试中取得了最先进的性能。
-
新的BEV-Forcing技术提升了驾驶VLA的零样本迁移能力
研究人员开发了一种名为BEV-Forcing的方法,以提高自动驾驶领域中视觉-语言-动作模型(VLAs)的零样本迁移能力。该技术将地面物体布局信息从专门的鸟瞰图(Bird's-Eye-View)模型转移到VLA骨干网络中,鼓励模型通过共享的空间接口来表示物体位置。研究发现,在有限数量的摄像头配置下进行训练时,BEV-Forcing可以同时提高模型在分布内和分布外(out-of-distribution)的性能,但随着训练多样性的增加,…
-
Qwen-Drive-1.0-4B 集成 3D 感知和运动规划
Qwen-Drive-1.0-4B 是一个新模型,它集成了 3D 感知、视觉问答和运动规划,构建在 Qwen3.5-4B 架构之上。它具有鸟瞰图 (BEV) 头部和流匹配规划器。该模型在 Apache 2.0 许可下发布,并在 NAVSIM 和 WOD-E2E 数据集上进行了基准测试。
-
CERF框架将协同感知通信成本降低95%
研究人员推出了一种名为CERF的新框架,旨在改进多个智能体之间的协同感知。该系统通过使用一种名为Poture的新型虚拟模态来增强现有特征,从而解决了通信开销和异构性挑战。CERF还采用卡尔曼滤波器和运动预测来减少传输延迟,实现了与现有方法相当的性能,同时将通信成本降低了95%。CERF的一个关键优势在于,它能够集成新的、未知的智能体,而无需额外的再训练。
-
CoAnchor 框架在数据错位下改进自动驾驶感知
研究人员推出 CoAnchor,一个旨在增强自动驾驶系统中协同感知能力的新框架。该系统解决了通信延迟和嘈杂的相对姿态数据带来的挑战,这些问题可能导致观测错位和不稳定的特征融合。CoAnchor 利用对象级时空锚点作为姿态校正的中心接口,将空间精炼、时间传播和验证整合到一个单一、高效的循环中。在模拟和真实世界数据上的实验表明,CoAnchor 在理想条件下能保持性能,并在面对延迟和姿态扰动组合时提高鲁棒性,提供了有利的准确性-效率权衡。
-
自动驾驶规划器使用流匹配进行实时控制
研究人员开发了一种新的用于自动驾驶的流匹配规划器,可以直接生成包括加速度和曲率剖面在内的控制轨迹。该模型以周围环境的鸟瞰图表示为条件,并能以低延迟推理生成控制序列,适合实时重新规划。该规划器仅在城市场景下进行训练,并证明了对多车道高速公路和未见过的城市环境等分布外环境的可靠泛化能力。
-
新的NCGR方法改进了基于相机的3D目标检测
研究人员开发了一种名为噪声条件门控校正(NCGR)的新方法,通过解决相机外参不准确的问题来改进相机中的3D目标检测。NCGR预测并应用2D校正偏移来纠正投影误差,而无需估计完整的六自由度外参校正。该方法在具有模拟扰动的nuScenes数据集上进行了评估,与BEVFormer和CAPE等现有方法相比,性能显著提高,同时在干净外参条件下保持了可比的性能。
-
CalibBEV方法对齐激光雷达-相机数据以改进标定
研究人员推出CalibBEV,一种通过对齐其鸟瞰图(BEV)表示来标定激光雷达和相机传感器的新方法。该方法将传感器数据统一到共享的3D空间表示中,从而实现更准确的跨模态标定。CalibBEV采用两步法:首先,它从BEV特征回归粗略的标定矩阵,并强制语义一致性与对比损失。其次,它通过显式对齐模态间的特征来精炼此估计。该方法在KITTI和nuScenes基准测试中显著优于先前技术,减少了旋转和平移误差。
-
新的视觉语言模型技术提高了自动驾驶的推理能力和效率
研究人员正在开发用于自动驾驶的视觉语言模型(VLM)的新方法,以提高推理能力并减少幻觉。一种方法 DEFT-RLVR 通过使未来轨迹成为验证目标而非预决策锚点来解决轨迹锚定偏差,从而实现更忠实的推理。另一种方法 TALSC 侧重于通过考虑传感器数据的及时性来优化大型和小型视觉语言模型在基础设施辅助自动驾驶中的协作。此外,MoRAL 提出了一种紧凑型视觉语言模型方法,该方法将推理与传感器数据相结合,从而在边缘设备上实现高效可靠的空间推理。
-
ViewMind3D框架实现了免训练3D问答
研究人员推出ViewMind3D,一个新颖的框架,用于使用多视图观测进行免训练3D问答。该模块化系统通过将任务分解为视图选择、视觉定位、通过鸟瞰图进行空间上下文编码以及结构化答案生成,从而绕过了昂贵的3D特定训练的需要。ViewMind3D在ScanQA和SQA3D等基准测试中表现出竞争力,尤其在空间定位问题上表现出色,并实现了强大的整体准确性。
-
FPSGen 框架独立于部分扫描生成 3D 点云场景
研究人员推出了一种新颖的 3D 点云场景生成框架 FPSGen。该方法通过将场景生成与部分扫描解耦来解决现有方法的局限性,从而避免了稀疏性和可见性相关的偏差。FPSGen 首先预测一个鸟瞰图(BEV)先验,然后将其用作无条件或有条件初始化的点源。一个教师-学生传输方案学习一个速度场来拉直传输路径,从而实现灵活的场景生成。
-
WASABI 管道为自动驾驶稳定车道拓扑
一篇新论文介绍 WASABI,这是一个实时后处理管道,旨在稳定自动驾驶系统的车道拓扑输出。WASABI 通过将车道段及其连接性视为联合跟踪目标来解决当前感知模型的缺陷,从而提高准确性并减少错误。该系统在车道连接检测 F1 分数方面取得了显著的提升,并减少了中心线横向误差,同时通过降低车道切换和标签闪烁率来增强时间稳定性。
-
新研究通过紧凑骨干网络和视觉模型增强三维检测 · 跟踪4个来源
两篇新研究论文介绍了通过更有效地集成激光雷达和相机数据来增强自动驾驶中三维目标检测的新方法。DeGuNet提出了一种专为深度引导学习设计的超紧凑图像骨干网络,将内存消耗降低高达66.5%,并提高推理速度,同时提升mAP增益。ViCo3D利用DINOv2等视觉基础模型从激光雷达数据中提取更丰富的语义先验,改善车联网系统中的协同感知,并取得最先进的成果。
-
BEVLM框架增强大语言模型在自动驾驶中的推理能力
研究人员开发了BEVLM,一个将大语言模型(LLMs)与鸟瞰图(BEV)表示相结合的新框架,用于自动驾驶。该方法旨在克服当前独立处理视觉数据的局限性,从而提高空间一致性和语义丰富性。BEVLM利用BEV特征作为大语言模型的统一输入,增强其在复杂驾驶场景中的推理能力,并提高端到端驾驶性能,尤其是在安全关键型情况下。
-
TGRIP框架使用文本引导语义进行自动驾驶预测 · 已追踪3个来源
研究人员推出了一种用于自动驾驶的新型框架TGRIP,通过整合语义信息来增强车辆实例预测。与以往仅依赖几何监督的方法不同,TGRIP利用视觉-语言基础模型生成语义丰富的鸟瞰图。该方法旨在通过提供明确的语义感知来提高模型处理复杂场景的能力,从而更准确地预测代理行为。在nuScenes数据集上的实验表明,TGRIP的表现优于现有的最先进模型。
-
新的 MVDGC 框架实现了联合 3D/2D 行人检测
研究人员推出了一种新颖的联合 3D 和 2D 多视角行人检测框架 MVDGC。该方法利用稀疏的 3D 圆柱形查询集,在鸟瞰图 (BEV) 和图像视图中强制执行双重几何约束。通过将行人建模为投影到图像视图中的矩形框的圆柱体,MVDGC 直接从完整的图像数据中提取特征,避免了传统透视变换引起的失真。
-
GaussianFusion 框架使用三维高斯进行多模态感知
研究人员推出了一种新颖的多模态融合感知框架 GaussianFusion,该框架利用三维高斯表示替代传统的鸟瞰图(BEV)网格。这种新方法在连续的三维高斯空间中统一了多模态特征,保留了精细细节并增强了跨模态交互。GaussianFusion 在各种三维感知任务中表现出卓越的性能,在三维目标检测方面优于 BEVFusion 等现有方法,在三维语义占用方面优于 GaussFormer。