原文:OccFeat:用于BEV分割网络预训练的自监督占用特征预测

出处:https://doi.org/10.48550/arXiv.2404.14027
在这里插入图片描述

在自动驾驶感知领域,纯视觉BEV(鸟瞰图)语义分割因无需依赖昂贵激光雷达、部署成本更低,成为行业研究热点。但传统方法过度依赖全监督训练,标注数据耗时耗力,尤其在低数据场景下性能急剧下降。CVPR 2024收录的OccFeat方法,通过创新的自监督预训练策略,同时兼顾三维几何与语义理解,彻底打破这一困境,为纯视觉BEV分割带来突破性进展。

核心痛点:纯视觉BEV分割的两大难题

纯视觉BEV分割需将多摄像头二维图像转换为三维鸟瞰图表示,核心挑战集中在两点:

  • 标注成本高昂:从图像到BEV空间的标注需经过激光雷达数据转换、多视角验证等多环节,工序复杂且耗时,大规模标注难以实现。
  • 低数据泛化性差:现有自监督预训练方法多聚焦三维几何预测(如占用估计、点云重建),缺乏语义信息引导,导致模型在少标注数据场景下语义分割精度不足。

纯视觉BEV感知

BEV感知旨在对车辆周围环境进行统一表示,已成为自动驾驶多摄像头感知系统的主流范式。基于摄像头的BEV模型通常由三部分组成:(i)跨摄像头共享的图像编码器,用于提取二维特征;(ii)视图投影模块,将特征“提升”到三维空间以生成BEV特征;(iii)一个或多个任务解码器模块,处理BEV特征以完成语义分割、地图预测、三维检测等目标任务。

OccFeat核心创新:几何+语义双管齐下的自监督预训练

OccFeat提出融合"三维占用重建"与"占用引导特征蒸馏"的双目标预训练框架,无需人工标注即可让模型同时掌握场景几何结构与语义信息,具体设计如下:
在这里插入图片描述

1. 三维占用重建:夯实几何感知基础

其目标是引导BEV网络学习编码场景三维几何信息的BEV特征。
在这里插入图片描述

借助激光雷达数据构建场景三维占用网格,判断每个体素是否包含激光雷达点(含则为占用状态)。模型通过学习预测这一占用分布,精准捕捉场景三维几何结构,为BEV表示提供空间感知能力。这一过程仅依赖原始激光雷达数据,无需人工标注。

2. 占用引导特征蒸馏:注入语义理解能力

创新引入DINOv2预训练图像基础模型,为被占用体素注入高级语义特征:将被占用体素的三维中心坐标投影到多摄像头图像特征图,通过双线性采样提取DINOv2语义特征,并作为目标引导BEV网络学习。这一设计让模型在掌握几何结构的同时,精准理解"哪个体素对应车辆、哪个对应道路"。

3. 双损失协同优化

总损失函数由占用重建损失(BCE损失)与特征蒸馏损失(负余弦相似度)加权组成,通过超参数λ平衡几何与语义学习优先级,实验证明λ=0.01时效果最优:

L = L o c c + λ ⋅ L f e a t \mathcal{L}=\mathcal{L}_{occ}+\lambda \cdot \mathcal{L}_{feat} L=Locc+λLfeat

关键实验结果:低数据场景性能碾压基线

研究团队在nuScenes数据集上针对车辆分割与地图布局分割任务开展全面验证,核心结果令人惊艳:

1. 低数据场景优势显著

仅使用1%标注数据时,OccFeat在SimpleBEV架构上实现车辆分割IoU达24.3,较无预训练提升10.6个百分点,较几何预训练基线Img-ALSO提升5.8个百分点;在BEVFormer架构上更实现13.6个百分点的跨越式提升,充分证明其在少标注数据场景下的实用性。

2. 架构适配性极强

无论是SimpleBEV的"拉式投影"还是BEVFormer的"注意力投影",OccFeat均能通过插件式预训练头实现性能提升,无需修改原有网络结构,适配性远超同类方法。

3. 鲁棒性与扩展性优异

在nuScenes-C基准测试中,面对雾天、低光、运动模糊等8类数据损坏场景,OccFeat预训练的模型分割精度显著高于无预训练模型,鲁棒性大幅提升。延长预训练至100个epoch后,性能进一步提升,展现出良好的扩展性。

核心价值:三大突破引领行业方向

  • 首次融合图像基础模型:创新性将DINOv2语义特征引入BEV预训练,是首个利用图像基础模型提升纯视觉BEV分割性能的方法,为跨模态知识迁移提供新思路。
  • 彻底降低标注依赖:在10%标注数据场景下仍保持高性能,大幅降低自动驾驶感知系统的标注成本,加速技术落地。
  • 兼顾几何与语义:打破传统方法"重几何、轻语义"的局限,实现三维空间中几何结构与语义信息的同步学习,提升模型泛化能力。

未来展望与应用场景

OccFeat在低数据场景的优异表现,使其特别适合城市新区、特殊天气等标注数据稀缺的自动驾驶场景。未来通过扩大预训练数据集规模、升级更大容量的DINOv2变体(如ViT-L/ViT-G),有望进一步提升全数据场景下的性能。此外,将时间维度信息融入预训练(如多帧激光雷达点云累积),可能成为下一阶段的重要优化方向。

OccFeat的提出,为纯视觉BEV分割提供了全新的自监督训练范式,既解决了标注成本高的行业痛点,又通过几何与语义的协同学习提升了模型实用性,有望加速低成本自动驾驶感知系统的商业化落地。感兴趣的读者可通过CVPR 2024官网或arXiv(2404.14027)获取论文全文及代码。


Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐