autonomous driving
PulseAugur coverage of autonomous driving — every cluster mentioning autonomous driving across labs, papers, and developer communities, ranked by signal.
- used by lidar 90%
- used by semantic segmentation 90%
- used by Birds Eye View 90%
- used by three-dimensional object detection 90%
- used by Camera 80%
- used by Nuscenes 70%
- developed by lidar 70%
- instance of Nuscenes 70%
- instance of alphaXiv 70%
- used by NAVSIM 70%
- used by Carla 70%
- instance of Gotit.pub 70%
14 天有情绪数据
-
TestifAI框架增强深度学习系统鲁棒性测试
研究人员开发了TestifAI,一个旨在改进深度学习系统测试的新框架,特别适用于自动驾驶等安全关键应用。该框架通过实现对输入扰动复杂组合的模型鲁棒性的系统化探索和总结,解决了当前方法的局限性。TestifAI采用一种称为部分模型层析的新方法,通过在较少测试结果上训练辅助模型来有效估计对多种扰动的鲁棒性,从而显著减少推理次数,同时保持高精度。
-
DrivingWorld: GPT式模型增强自动驾驶视频生成
研究人员开发了 DrivingWorld,一个专为自动驾驶应用设计的新型 GPT 式世界模型。该模型通过整合时空融合机制来解决传统 GPT 框架的局限性,从而有效地模拟生成逼真未来视频序列和预测自我状态所需的动态。DrivingWorld 能够生成超过 40 秒的高保真、一致的视频片段,在视觉质量和可控的未来视频生成方面均显著优于现有的最先进的驾驶世界模型。
-
InfiniVerse 管道为自动驾驶生成无界城市场景
研究人员推出了 InfiniVerse,这是一个专为自动驾驶应用生成动态和无界城市场景的新型管道。该系统从单个帧重建 3D 占用表示,通过视频扩散模型实现自回归场景扩展和转换为逼真的视频序列。InfiniVerse 还采用分层草图-精炼范式,利用视觉反馈增强 3D 占用表示,在 Waymo Open Dataset 和 nuScenes 上取得了最先进的性能。
-
新的AdROD系统增强了自动驾驶目标检测的对抗鲁棒性
研究人员开发了AdROD,一种旨在增强自动驾驶汽车目标检测对抗鲁棒性的新型防御系统。AdROD利用低秩超网络,显著降低计算开销,实时生成多样化检测器。该方法旨在对抗可能抑制目标检测的物理对抗攻击,这是自动驾驶系统的关键漏洞。该系统包括两种模式:AdROD-I用于持续保护,AdROD-II用于按需激活,在模拟环境和真实世界补丁测试中表现优于现有防御措施。
-
RapidLiDAR 实现实时激光雷达场景补全,速度提升 2.3 倍
研究人员开发了 RapidLiDAR,一种用于实时激光雷达场景补全的新颖方法,显著提高了速度和适应性。与依赖固定噪声扰动或慢速生成模型的前辈方法不同,RapidLiDAR 使用了学习到的、数据驱动的组件进行场景初始化。这个自适应初始化模块预测输入点的空间变化位移,在无需手动调整的情况下创建适应局部几何的粗略场景。该系统进一步使用多尺度体素和 BEV 特征图来精炼此初始化,实现了最先进的补全性能,同时仅用 0.1 秒即可处理完整场景,比…
-
新协议增强自动驾驶安全测试
研究人员推出了一种名为RISC(Risk-Informed Slice Coverage,基于风险的切片覆盖)的新协议,旨在提高自动驾驶系统的安全性和评估水平。该协议通过关注高风险驾驶条件并提供明确的覆盖证据来指导测试。通过将有限的审计预算导向相关数据子集,RISC旨在比随机抽样更有效地发现关键故障。概念验证表明,RISC能够显著增加行人感知模块中关键故障的发现率。
-
新框架增强了对自动驾驶中细微GPS欺骗的检测能力
研究人员开发了一个名为高阶液体证据编码的新框架,以提高对自动驾驶系统中渐进式GNSS欺骗攻击的检测能力。该方法解决了细微攻击的挑战,在这种攻击中,单个GPS读数仍然是合理的,但与车辆运动的不一致会随着时间的推移而累积。通过分析残差信号及其通过自适应液体编码器的变化,该框架旨在提供更强大、更及时的检测这些不断演变的威胁。在AV-GPS数据集上的实验表明,该方法在识别欺骗转换方面具有较高的F1分数,证明了其有效性。
-
摄像头凝视数据未能改善自动驾驶危险检测
一篇新的研究论文探讨了通过网络摄像头捕获的人类凝视数据是否能帮助自动驾驶模型避免发展出“桌面目标”(mesa-objectives)——即通过虚假关联而非真正识别危险来获得高训练性能的内部目标。研究发现,尽管收集了超过137,000个凝视样本,但在纳入凝视数据后,危险检测并未有统计学上的显著改善。研究人员得出结论,当前网络摄像头眼动追踪技术的精度不足,其误差超过了大多数已检测到的危险的大小,因此无法准确地将凝视归因于特定物体。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
新数据集和框架增强自动驾驶中的三维视觉定位
研究人员推出了Talk2Sensors,这是一个用于自动驾驶中三维视觉定位的新型数据集和框架,它利用了多种传感器模态。该数据集包含超过8000条语言指令和20000个指代对象,专门设计用于匹配来自摄像头、LiDAR和4D雷达的传感器特定物理线索。提出的TSFormer框架采用粗粒度到细粒度的属性感知融合策略,能够根据语言要求动态路由外观、几何和运动线索,从而实现最先进的性能。
-
新的DriveCode方法提升了LLM在自动驾驶领域的精度
研究人员开发了DriveCode,一种新的数值编码方法,旨在提高大型语言模型(LLM)在自动驾驶系统中的性能。传统的LLM由于分词限制,在精确数值推理方面存在困难。DriveCode通过将数字映射到LLM隐藏空间中的专用嵌入来解决这个问题,从而能够更好地将数值数据与视觉和文本信息集成。在OmniDrive、DriveGPT4和DriveGPT4-V2等数据集上的评估表明,DriveCode能够增强轨迹预测和控制信号生成。
-
新的视觉语言模型技术提高了自动驾驶的推理能力和效率
研究人员正在开发用于自动驾驶的视觉语言模型(VLM)的新方法,以提高推理能力并减少幻觉。一种方法 DEFT-RLVR 通过使未来轨迹成为验证目标而非预决策锚点来解决轨迹锚定偏差,从而实现更忠实的推理。另一种方法 TALSC 侧重于通过考虑传感器数据的及时性来优化大型和小型视觉语言模型在基础设施辅助自动驾驶中的协作。此外,MoRAL 提出了一种紧凑型视觉语言模型方法,该方法将推理与传感器数据相结合,从而在边缘设备上实现高效可靠的空间推理。
-
新框架定义具身AI系统的可信度
提出了一种新的可信具身智能系统框架,整合了感知、决策和物理交互。该框架通过将机制组织成四个层次:模型、系统、证据和部署,强调持续的安全成功。它旨在通过考虑变异下的可靠性并维持可接受的风险水平,来建立超越单纯任务完成的可信度。该提案还引入了一个可信度水平层级,用于对能力、安全、保障、治理和证据等方面的声明进行分级,从而促进评估和标准化。
-
新的物理攻击方法使用红外光攻击光流估计网络
研究人员开发了一种新颖的方法,使用红外光实时物理攻击光流估计网络 (OFENs)。该方法预先生成大量对抗性样本并动态显示它们,从而能够在不改变受害者系统的情况下进行精确的目标攻击。该技术在各种光照条件、物体速度和放置下均显示出有效性,显著削弱了网络的光流估计能力。
-
新的TTCov方法通过使训练数据与实际条件相匹配来改进AI部署
研究人员开发了一种名为TTCov(Test-Time Coverage)的新数据策选方法,旨在提高AI系统在实际部署场景中的性能。TTCov侧重于将训练数据与部署环境的具体条件相匹配,而不是仅仅优化训练端指标。该方法构建了一个“知识图谱”(K-Atlas),通过识别和量化相关概念来表示部署分布,然后指导训练数据集的选择。应用于自动驾驶领域,TTCov与现有数据策选技术相比,展现出更优越的性能和适应性。
-
新的CARA框架增强了自动驾驶中的碰撞预测能力
研究人员开发了CARA(Concept-Aware Risk Attention,概念感知风险注意力),一个旨在增强自动驾驶系统碰撞预测能力的新框架。CARA通过从事故叙述中提取风险概念,并利用视觉-语言相似性将其与视频帧对齐,来提供可解释的推理。这种方法使语义概念能够直接影响模型的空间和时间注意力,从而提高预测准确性和预警提前量。
-
新方法提升自动驾驶全天候深度估计能力
研究人员开发了一种新的自监督深度估计方法,旨在提高自动驾驶系统在恶劣天气条件下的鲁棒性。该方法通过采用多教师蒸馏和一种新颖的POV-BEV雷达融合技术,解决了传感器退化和雷达数据稀疏性带来的挑战。该方法利用非配对的真实世界数据生成多样化的教师模型,并使用不确定性建模来加权知识蒸馏,而雷达融合则连接摄像头和雷达视图以实现更全面的感知。
-
SafeGen框架为自动驾驶VLM生成安全关键场景
研究人员开发了SafeGen,一个新颖的目标条件扩散框架,旨在为自动驾驶系统使用的视觉语言模型(VLM)生成安全关键场景。该方法使用预定义的灾难性终态作为监督信号,引导生成朝着高风险结果发展的逼真视频轨迹。SafeGen利用VLM推断人车交互中的潜在漏洞,并将其转化为物理上可行的视觉动态,从而提高VLMAD的理解和决策能力。实验表明,SafeGen显著提高了基于VLM的自动驾驶系统的性能,从而提高了安全评估分数和实际驾驶性能。
-
混合机器学习模型改进了自动驾驶卡车的关节角估计
研究人员开发了混合机器学习模型,以准确估计卡车半挂车组合的关节角,这是自动驾驶和高级驾驶员辅助系统的关键任务。这些模型通过直接从视觉和运动学输入估计角度,消除了手动初始化、附加传感器或特定于拖车的信号的需求。该混合方法集成在具有自适应加权方案的扩展卡尔曼滤波器框架内,在各种拖车类型和条件下的广泛真实世界实验中展示了鲁棒性和泛化能力。
-
多目标跟踪:赋予AI系统超越目标检测的记忆能力
多目标跟踪(MOT)是目标检测的一项进步,它为视频流中识别出的对象提供了身份、记忆和历史背景。这对于自动驾驶和零售分析等应用至关重要,在这些应用中,理解场景如何随时间演变至关重要。与将每一帧独立处理并存在闪烁和对象“遗忘”问题的纯目标检测不同,MOT通过赋予计算机记忆能力,实现了更智能的系统。