【如果笔记对你有帮助,欢迎关注&点赞&收藏,收到正反馈会加快更新!谢谢支持!】

往期:

自动驾驶Occupancy梳理笔记(一)-CSDN博客

自动驾驶Occupancy梳理笔记(二):SurroundOcc, OccFormer, VoxFormer, FB-OCC-CSDN博客

重要论文梳理

2.9 SelfOcc: Self-Supervised Vision-Based 3D Occupancy Prediction [CVPR 2024]

  • 任务:自监督3D占用预测(只需要RGB视频监督,不需要Occ真值)
  • 为什么做自监督occ预测?不需要精细3D标注
  • Pipeline:
    前视图/环视图【输入】→ 2D Encoder & FPN【提取图像特征,多尺度特征融合】→  2D-3D视角转换【得BEV特征或TPV特征(过occ head得occ结果)】→ MLP【预测SDF值、颜色和语义】→ 体渲染【生成2D图进行监督】
  • 核心模块:3D表征→2D图
    • SDF(符号距离场):描述物体表面的方式,每个点的值为该点到最近表面的距离,正负表示内部还是外部
    • 流程:3D表征 → Decoder【解码到SDF值和颜色】→ 体渲染生成2D图【模拟光线,收集射线上点的信息】
  • 监督策略:面向Occ监督(但不是用Occ真值监督)
    • MVS-embedded深度学习:直接优化射线上的深度权重(避免复杂积分过程)
    • 多帧监督(补充当前不可见区域的信息)
    • SDF场正则化:Eikonal loss(提高SDF的空间连续性),限制SDF的二阶导(控制SDF场平滑度),稀疏性约束(不可见区域预测为空)

2.10 SparseOcc: Rethinking Sparse Latent Representation for Vision-Based Semantic Occupancy Prediction [CVPR 2024]

  • 任务:3D语义占用预测
  • 优化点:3D体素表征复杂度高,BEV/TPV等投影表征丢失信息 → 无损3D稀疏表征
  • Pipeline: 
    前视图/环视图【输入】→ Img Backbone【图像编码】→ LSS【得稀疏3D体素特征】→  Sparse Latent Diffuser【特征扩散】→  Sparse Feature Pyramid【得多尺度occ表示】→  Sparse Transformer Head【解码】→ Occ预测结果
  • 核心模块1: Sparse Latent Diffuser
    • 作用:特征扩散,并保持特征稀疏性
    • Sparse Completion Block:用3DConv做特征扩散
    • Contextual Aggregation Block: 整合语义和几何信息,用稀疏子流形卷积保持稀疏性
  • 核心模块2: Sparse Feature Pyramid
    • 下采样的多尺度稀疏FPN,得到场景不同尺度的表示
  • 核心模块3: Sparse Transformer Head
    • (参考mask2former)通过Attention Mask更新迭代query
  • Loss:mask loss + 分类loss + 深度loss + 非空体素分割loss

2.11 Fully Sparse 3D Occupancy Prediction [ECCV 2024]

(注:这篇也叫 SparseOcc)

  • 任务:3D语义占用预测
  • 优化点:只需要构建稀疏的3D表示,通过纯稀疏的Occ架构实现(Occ本身具有稀疏性,因为大部分为空气)
  • Pipeline:
    环视图【输入】→ 2D Encoder & FPN【提取图像特征,多尺度特征融合】→ Sparse Voxel Decoder【Occ几何重建】→ Mask transformer【Occ语义重建】→ Occ预测结果
  • 核心模块1: Sparse Voxel Decoder
    • Coarse-to-fine 粗到细架构,只对占据区域建模
    • Voxel query → Self-Attention → 采样图像特征&聚合多帧特征 → 体素上采样 → 稀疏化(根据分数决定该voxel是否被丢弃)
  • 核心模块2: Mask transformer
    • 把cross-attention换成稀疏采样,使用mask-guided策略,实现语义预测(类似上一篇SparseOcc)
  • 新评测指标:RayIoU
    • Voxel-level mIoU缺陷:如果把不可见区域都填满,会大幅涨点,但是不能真正提升性能
    • RayIoU:将Query ray投射到预测的3D Occ,通过射线上GT和pred的voxel相交情况(IoU)计算,可以提高场景补全能力

2.12 OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving [ECCV 2024]

  • 任务:未来帧Occ预测(世界模型)
  • Pipeline: 
    输入历史Occ (真值 or 感知模型预测) → VQ-VAE编码器【得过去帧场景token&自车位置】→ 时空生成式transformer【预测未来帧场景token&自车位置】→ VQ-VAE解码器 → 未来Occ
  • 推理时,用自回归的方式预测下一帧Occ
  • 核心模块1: Scene Tokenizer
    • 作用:得到Occ场景的压缩表示(token形式)
    • 实现方式: Vector-Quantized Autoencoder (VQ-VAE) 
      •  Occ → Encoder → Quantized Vector → Decoder  → Occ (重建版)
      • Quantized Vector存在可学习的Codebook中,Scene Token用Codebook的索引值表示
  • 核心模块2: Spatial-Temporal Generative Transformer
    • Unet结构,用self-attention进行token时间和空间的交互
  • 训练:
    • 阶段一:VQ-VAE,单帧重建学习
    • 阶段二:固定VQ-VAE,得到场景token,训练Transformer

Logo

助力广东及东莞地区开发者,代码托管、在线学习与竞赛、技术交流与分享、资源共享、职业发展,成为松山湖开发者首选的工作与学习平台

更多推荐