autonomous driving
PulseAugur coverage of autonomous driving — every cluster mentioning autonomous driving across labs, papers, and developer communities, ranked by signal.
- used by lidar 90%
- used by three-dimensional object detection 90%
- used by Birds Eye View 90%
- used by semantic segmentation 90%
- used by Camera 80%
- used by Nuscenes 70%
- developed by lidar 70%
- instance of Nuscenes 70%
- instance of alphaXiv 70%
- used by Carla 70%
- used by bird's-eye view 70%
- instance of three-dimensional object detection 70%
9 天有情绪数据
-
新的BEVPIPE框架支持自动驾驶感知模型的便携式GPU部署
研究人员开发了BEVPIPE,一个旨在解决自动驾驶系统中部署复杂鸟瞰图(BEV)感知模型挑战的新框架。这些模型通过融合摄像头和LiDAR数据进行3D物体检测,由于标准推理运行时与稀疏3D卷积等专用操作之间的不匹配,常常面临部署问题。BEVPIPE对这些模型进行分区,允许密集子图由生产运行时管理,同时使用外部扩展来处理稀疏操作。据报道,这种方法实现了显著的加速并保持了高精度,同时还能在不同的GPU后端之间实现便携性。
-
生成式人工智能调查报告详述了自动驾驶领域的前沿与机遇
一篇新的调查论文探讨了生成式人工智能(GenAI)在自动驾驶领域的应用,特别关注实现L5级别自动驾驶。该论文详细介绍了各种生成模型,如VAEs、GANs、Diffusion Models和LLMs,以及它们在生成合成数据、实现端到端驾驶策略和创建智能交通网络方面的应用。论文还讨论了泛化性、安全性、伦理关切和监管合规性等挑战,并提出了未来的研究方向。
-
新框架使视觉模型与自动驾驶更好地对齐
研究人员开发了ViRA,一个旨在为端到端自动驾驶系统对齐视觉表征的框架。他们的研究发现,使用这些由视觉基础模型(VFM)引导的表征,即使在零样本评估中,也能持续提高各种规划器的驾驶性能。特定VFM的选择至关重要,并且与不同的VFM对齐可以使已经使用VFM编码器的规划器受益。此外,引入辅助感知监督可以减轻不太理想的VFM选择带来的影响。
-
TopoCurve 使用贝塞尔曲线实现自动驾驶中的高级车道线检测
研究人员开发了TopoCurve,一种用于自动驾驶的新型架构,它使用贝塞尔曲线来表示3D车道线。与传统的折线方法相比,这种几何感知方法能够实现具有明确切线和更好空间支持的更平滑的车道线表示。TopoCurve 在 OpenLane-V2 基准测试中取得了端到端纯摄像头方法的最新成果,在端点检测方面优于先前的方法。
-
可穿戴眼动追踪器精度评估用于自动驾驶
一项新近发表在arXiv上的研究评估了可穿戴眼动追踪器在自动驾驶系统中的精度。研究人员开发了一个框架,用于量化真实驾驶条件下的注视点追踪精度,发现平均误差为4.58度。室内研究表明,头部运动、光照和注视偏心等因素会显著影响精度,这表明在自动驾驶汽车中可靠的鸟瞰式监控可能需要在线重新校准。
-
新型对抗性攻击针对自动驾驶领域的视觉语言模型
研究人员开发了一种名为时空连贯性对抗性攻击(STCA)的新型对抗性攻击方法,该方法专门针对自动驾驶系统使用的黑盒视觉语言模型(VLMs)。该攻击分为三个阶段:用于语义帧选择的模态扩展,用于在保持相似性的同时创建扰动的空间攻击,以及使用运动引导掩码来破坏时间连贯性的STCA阶段。在BDD100K和nuScenes数据集上使用Video LLaVA-7B、Qwen2.5-VL-7B和Dolphin等模型进行的实验表明,当前的VLMs极易受…
-
新AI方法改进自动驾驶天气识别
研究人员开发了一种名为“面向天气的对抗性判别域自适应”(WA-ADDA)的新方法,以改进街景图像的天气识别,这是自动驾驶系统的关键任务。该技术解决了域偏移的挑战,即训练数据通常来自与真实驾驶条件差异很大的非街景来源。WA-ADDA将域判别器条件化为预测天气,使模型能够学习到对域不变且对天气敏感的特征。研究人员还通过统一各种非街景天气集合创建了一个基准数据集,并建立了标准化的评估协议。他们的方法在不同神经网络骨干上持续提高街景性能,在晴…
-
密歇根大学开发泡泡式方向盘以缓解驾驶员与自动化系统的冲突
密歇根大学的研究人员开发了一种新颖的方向盘,旨在缓解人类驾驶员与自动驾驶系统之间的冲突。这款创新的方向盘在后表面集成了气泡和气囊,旨在提供更直观的反馈并改善人机界面。
-
新研究探索用于自动驾驶安全与规划的高级AI · 追踪10个来源
arXiv上发表的多篇研究论文探讨了自动驾驶系统的先进技术,重点是改进规划、预测和安全。其中一篇论文介绍了一个分层评估协议,用于评估生成场景模型的物理一致性,揭示了标准指标未显现的局限性。另一篇论文提出了Diffusion-2BC,一种用于离线行为克隆的混合扩散和回归训练方法,可提高闭环性能。此外,对规则对齐扩散规划器(RADP)的研究旨在将驾驶规则直接纳入扩散模型,以提高可解释性和安全性,同时正在开发Meta-多智能体强化学习(me…
-
综述梳理机器人智能的世界-动作模型
这篇综述论文全面回顾了用于机器人学习与控制的世界-动作模型(WAMs)。它将现有方法组织成一个统一的分类体系,涵盖了表示、转移建模、动作接口、架构、训练流程、数据模态和扩展策略。论文还探讨了WAM在操作、导航和自动驾驶中的应用,并讨论了诸如动作对齐、空间一致性和长时记忆等关键挑战。目标是为整合预测性世界建模与动作生成奠定技术基础,以增强具身机器人的智能。
-
Robusto-2论文对VLMs与人类驾驶员在自动驾驶方面的表现进行了基准测试
一项新的研究论文Robusto-2,在模拟自动驾驶场景中,对视觉语言模型(VLMs)与人类驾驶员的表现进行了基准测试。该研究使用了来自利马和纽约市的行车记录仪录像,提出了事实性、评分性、反事实性和推理性类别的问题。研究人员发现,来自这两个城市的人类驾驶员的反应相似,而VLMs的回答则存在差异,尽管地理位置对人类或VLMs的反应没有显著影响。
-
新的ROVR数据集旨在推进自动驾驶深度估计
研究人员推出ROVR,一个用于自动驾驶的新大规模深度数据集,旨在克服现有数据集(如KITTI和nuScenes)的局限性。ROVR包含200,000张高分辨率帧,涵盖北美、欧洲和亚洲的各种驾驶场景、天气条件和地理位置。该数据集的成本效益高的采集流程和公开支持工具旨在实现可扩展性和可重复性,从而能够对深度估计架构中的常见故障模式进行更稳健的模型训练和分析。
-
新框架改进了自动驾驶的以自我为中心的对象识别
一篇新研究论文介绍了一种用于在自动驾驶场景中从自车角度识别关键对象的两阶段框架。第一阶段使用对象状态预测器来估计对象相对于自车的行为,第二阶段则采用时空推理,根据对象状态和空间信息来完善识别。该方法旨在提高复杂交通环境中的关键对象检测能力,其性能优于未明确考虑自车视角的现有方法。
-
GEM模型使用可变形Mamba进行先进的激光雷达世界建模
研究人员开发了GEM,一种用于自动驾驶中基于激光雷达的世界建模的新型生成模型。该模型利用可变形Mamba架构来克服激光雷达点云的无序性和动态与静态物体区分相关的挑战。GEM处理标记化的激光雷达扫描,解耦特征,并采用三路径可变形Mamba以增强时空理解,在各种基准测试中取得了最先进的性能。
-
新型对抗性服装利用3D建模欺骗热成像人体检测器
研究人员开发了一种旨在欺骗热成像人体检测器的物理对抗性服装,该技术应用于自动驾驶和医疗诊断等领域。该服装利用3D建模模拟多角度场景,并采用气凝胶贴片构成,在热成像中显示为黑色方块。该方法在室内对YOLOv9检测器的攻击成功率为80.11%,在室外为76.85%,显著优于随机放置的贴片。
-
新的arXiv论文总结了深度估计的进展并引入了新颖的扩散模型
两篇新的arXiv论文探讨了单目深度估计的进展,这是一项基础的计算机视觉任务。第一篇论文对该领域进行了全面调查,追溯了其从早期方法到像DINOv3这样的基础模型的影响及其在机器人和自动驾驶等领域的应用。第二篇论文介绍了Lapis,一个利用线性注意力和像素空间扩散实现高效、高保真度深度估计的新颖框架,以显著缩短的推理时间实现了最先进的准确性。
-
研究:投影选择影响360度内容的学习视频压缩
一篇新的研究论文探讨了不同的投影格式如何影响360度内容的端到端学习视频压缩的效率。研究发现,等距柱状投影和填充等距柱状投影对于神经压缩模型最有效,这与传统编解码器中基于立方体贴图的格式表现更好不同。这些发现为优化基于学习的360度视频压缩系统中的投影选择提供了指导。
-
新的数据集旨在提升MLLM在自动驾驶领域的安全性 · 跟踪2个来源
研究人员推出了两个新数据集WaymoQA和Inter-3D VQA,旨在提高多模态大语言模型(MLLMs)在自动驾驶场景中的安全关键推理能力。WaymoQA利用多视图输入,专注于复杂、高风险的驾驶情况,以克服单视图视角的局限性;而Inter-3D VQA则提供了一个带有同步点云和多视图图像的路侧基准,用于评估交叉口的3D基础推理能力。实验表明,当前的MLLMs在这些安全关键任务上表现不佳,但使用这些新数据集进行微调可以显著增强它们的推…
-
自动驾驶AI模型未能将推理与行动对齐,新数据集揭示
两篇新的arXiv论文探讨了当前自动驾驶推理模型的局限性。第一篇论文调查了现有方法,将其分为基于语言、视觉空间、潜在动态和外化推理,并强调了真实世界基础和安全关键验证的必要性。第二篇论文介绍了KITScenes LongTail数据集,用于评估推理-行动一致性,结果显示模型在陈述推理的同时,往往无法执行相应的行动,尽管其推理本身更为准确。
-
Qwen-Drive-1.0 集成了 3D 感知、VQA 和运动规划,用于自动驾驶
Qwen 推出了 Qwen-Drive-1.0,一个专为自动驾驶设计的视觉语言基础模型。该模型通过利用预训练的 VLM 架构和外部模块,统一了 3D 感知、视觉问答和运动规划。它包含一个鸟瞰视角感知头,用于 3D 对象检测和语义占用预测等任务,以及一个用于生成未来轨迹的规划专家。该模型采用分阶段的配方进行训练,结合了驾驶监督和通用视觉语言数据,以保持广泛的能力。