Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection

Fu, Jiahui; Gao, Chen; Wang, Zitian; Yang, Lirong; Wang, Xiaofei; Mu, Beipeng; Liu, Si

Computer Science > Computer Vision and Pattern Recognition

arXiv:2403.07372 (cs)

[Submitted on 12 Mar 2024]

Title:Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection

Authors:Jiahui Fu, Chen Gao, Zitian Wang, Lirong Yang, Xiaofei Wang, Beipeng Mu, Si Liu

View PDF HTML (experimental)

Abstract:Recent 3D object detectors typically utilize multi-sensor data and unify multi-modal features in the shared bird's-eye view (BEV) representation space. However, our empirical findings indicate that previous methods have limitations in generating fusion BEV features free from cross-modal conflicts. These conflicts encompass extrinsic conflicts caused by BEV feature construction and inherent conflicts stemming from heterogeneous sensor signals. Therefore, we propose a novel Eliminating Conflicts Fusion (ECFusion) method to explicitly eliminate the extrinsic/inherent conflicts in BEV space and produce improved multi-modal BEV features. Specifically, we devise a Semantic-guided Flow-based Alignment (SFA) module to resolve extrinsic conflicts via unifying spatial distribution in BEV space before fusion. Moreover, we design a Dissolved Query Recovering (DQR) mechanism to remedy inherent conflicts by preserving objectness clues that are lost in the fusion BEV feature. In general, our method maximizes the effective information utilization of each modality and leverages inter-modal complementarity. Our method achieves state-of-the-art performance in the highly competitive nuScenes 3D object detection dataset. The code is released at this https URL.

Comments:	Accepted by ICRA 2024
Subjects:	Computer Vision and Pattern Recognition (cs.CV)
Cite as:	arXiv:2403.07372 [cs.CV]
	(or arXiv:2403.07372v1 [cs.CV] for this version)
	https://doi.org/10.48550/arXiv.2403.07372

Submission history

From: Chen Gao [view email]
[v1] Tue, 12 Mar 2024 07:16:20 UTC (3,057 KB)

Computer Science > Computer Vision and Pattern Recognition

Title:Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection

Submission history

Access Paper:

References & Citations

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators

Computer Science > Computer Vision and Pattern Recognition

Title:Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection

Submission history

Access Paper:

References & Citations

BibTeX formatted citation

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators