
“谁更吃算力”这个问题,答案并非单一维度。如果只看传感器数据处理阶段,激光雷达的“算力税”更直接;但如果把视野拉到模型训练和算法复杂度上,纯视觉对算力的渴求则是指数级的。两者的“吃法”完全不同:激光雷达吃的是结构化数据的实时预处理算力,纯视觉吃的是从二维重建三维的推断算力与训练算力。激光雷达融合:显性的“预处理算力税”激光雷达融合方案的算力消耗,主要来自点云数据处理和多传感器对齐,这部分开销是刚性的、可量化的。激光雷达每秒产生百万级的三维点云数据(典型约12万点/帧,20帧/秒)。这些点云无序、稀疏、伴随噪点,不能直接喂给神经网络,必须先经过去畸变、时间同步、体素化等预处理步骤。以一颗激光雷达为例,仅预处理就可能占用可观的CPU算力;如果堆叠多颗雷达,数据量线性增长,200 TOPS级别的芯片光处理三颗雷达的去畸变和同步,CPU占用率就可能高达60%-70%。点云检测网络本身的算力消耗其实不算高。运行经典的PointPillars点云检测网络,大概只需要10-15 TOPS;更先进的TransFusion架构,算力消耗通常在30-50 TOPS之间。问题在于,融合方案不止跑点云检测,还要跑视觉分支,并在BEV空间做跨模态特征对齐(如BEVFusion中的LSS池化、交叉注意力)。学术研究指出,多模态BEV融合的瓶颈往往不在算力峰值,而在内存带宽饱和——体素化、投影变换等操作会