PulseAugur
EN
LIVE 05:53:49

New XET-V2X framework enhances autonomous driving perception via multimodal fusion

Researchers have developed XET-V2X, a novel framework for end-to-end 3-D spatiotemporal perception in autonomous driving that integrates multimodal sensing and vehicle-to-everything (V2X) collaboration. The system utilizes a dual-layer spatial cross-attention module to effectively align heterogeneous viewpoints and modalities, enhancing semantic consistency and enabling cross-modal interaction. Experiments on the V2X-Seq-SPD dataset and simulated subsets show significant performance gains, with XET-V2X achieving up to 15-20% relative improvements in mAP and AMOTA compared to baseline methods, particularly under varying communication delays. AI

IMPACT This research could lead to more robust and reliable perception systems for autonomous vehicles, especially in complex V2X communication environments.

RANK_REASON The cluster contains a research paper detailing a new technical framework for autonomous driving perception. [lever_c_demoted from research: ic=1 ai=1.0]

Read on arXiv cs.CV →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

New XET-V2X framework enhances autonomous driving perception via multimodal fusion

COVERAGE [1]

  1. arXiv cs.CV TIER_1 English(EN) · Zhenwei Yang, Yibo Ai, Weidong Zhang ·

    End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

    arXiv:2512.21831v2 Announce Type: replace Abstract: Multiview cooperative perception and multimodal fusion are essential for reliable 3-D spatiotemporal understanding in autonomous driving, especially in cases with occlusions, limited viewpoints, and communication delays in vehic…