返回专辑
·Johan·5 分钟阅读

LiDAR 与视觉 SLAM 的深层差异:几何、退化与融合可观性

从点到面 ICP、LOAM 特征、视觉尺度与场景退化模式出发,分析何时单传感器必然失败,以及松/紧耦合融合如何改变信息结构。

LiDAR 与视觉 SLAM 的深层差异:几何、退化与融合可观性

「雷达准、视觉便宜」是总结,不是分析。真正决定选型的是:测量模型、退化流形、外点机制,以及你准备用什么绝对信息钉住不可观自由度

测量模型本质不同

1.1 视觉:投影几何

视觉观测是光线方向(加光度)。单目单帧深度不可观;深度来自:

  • 多视图三角化
  • 立体基线
  • RGB-D
  • IMU / 轮速尺度

误差主要来自:标定、匹配错误、曝光、运动模糊、滚动快门。

1.2 LiDAR:主动测距几何

机械式旋转雷达给出极坐标点;误差来自:

  • 距离噪声(与反射率、距离相关)
  • 光束发散
  • 运动畸变(一帧扫描期间机体在动)
  • 多径 / 透射(玻璃)

点云直接是米制,但结构退化时纵深不可观,这一点常被低估。

LiDAR 前端:不止是「ICP 一下」

2.1 点到面 / 点到线

经典点到面残差:

text
r = nᵀ ( R p + t - q )

p 当前点,q 地图对应点,n 局部平面法向。比点到点 ICP 更抗采样密度变化。

LOAM 系进一步:

  • 大曲率 → 角点(edge)→ 点到线
  • 小曲率 → 平面点 → 点到面

这是在显式选择高信息几何特征,不是均匀用全部点。

2.2 运动畸变补偿

一帧扫描跨度 ΔT(如 100 ms)内,位姿连续变化。未去畸变时,墙壁会「弯」。

紧耦合 LIO(如 FAST-LIO)用 IMU 高频姿态对点云做去畸变,再做迭代卡尔曼 / 优化更新。视觉的「一帧曝光」更短,但 IMU 对 VIO 同样关键。

2.3 退化检测

对法向协方差 / 约束方向做 PCA:若特征值呈现「一个方向特别小」,说明该方向位移不可观(长廊)。

工程响应:

  • 降低该方向的更新步长
  • 引入轮速 / IMU / 视觉纹理约束
  • 拒绝在退化方向做地图更新

没有退化检测的 LiDAR SLAM,在地下车库长直道会「滑行」。

视觉前端:特征法 vs 直接法(信息视角)

特征法直接法
残差几何(重投影)光度
外点RANSAC / 鲁棒核对曝光敏感
弱纹理失效亦失效,但可利用微小梯度
高速模糊描述子崩光度一致性崩

深层差异:特征法把图像压缩成稀疏路标,后端清晰;直接法信息量大但对辐射标定要求高。半直接(SVO 系)折中。

视觉的「纹理退化」≈ LiDAR 的「结构退化」,只是失效场景互补。

尺度、重力与绝对锚点

传感器组合尺度重力对齐长期全局
单目 VO不可观不可观
双目 / RGB-D可观仍漂
单目 VIO可观(需激励)可观仍漂
LiDAR Odometry可观需 IMU/地面假设仍漂
+ 回环相对全局改善
+ GPS/UWB/磁钉绝对可锚定

结论:任何里程计都会漂;差别是漂的速度、方向,以及你用什么闭环/绝对观测把它钉住。

失效模式对照(用于方案评审)

5.1 视觉容易死在

  • 暗光 / 强逆光
  • 白墙、玻璃幕墙反射错匹配
  • 动态行人占画面
  • 镜头雾/污
  • 夜景车灯拖影

5.2 LiDAR 容易死在

  • 长廊、隧道、空旷广场(几何退化)
  • 大雨雾雪(散射)
  • 玻璃/黑车身(漏检或噪点)
  • 正对强反光金属
  • 多雷达外参漂移

5.3 两者都怕

  • 时间同步错误
  • 外参错误
  • 剧烈冲击导致结构形变
  • 无回环的超长轨迹

评审表不要写「雷达更稳」,要写「我们场地是否存在长廊退化?是否有玻璃?光照是否可控?」

融合:改的是信息矩阵,不是「加权平均轨迹」

6.1 松耦合

T_visualT_lidar 作为相对位姿因子进入图。实现简单,但:

  • 两套前端的相关性难建模
  • 容易双计数同一几何(相机看到的墙与雷达扫到的墙)

6.2 紧耦合

同一状态上同时挂视觉残差与点到面残差(+ IMU)。信息利用充分,但工程复杂度高。

6.3 谁主导?

实用策略:

  • 结构化室内物流:LiDAR(+IMU) 主导定位;视觉做识别/对接
  • 高空 / 轻小平台:VIO 主导;必要时稀疏视觉重定位
  • 地下车库:LiDAR+IMU,视觉辅助抗退化(纹理墙面)
  • 对接充电桩:全局激光定位 + 近场视觉/红外标签

主导传感器决定失败安全策略:主传感器失效时是减速停,还是降级续航。

算力与数据率

粗算(数量级):

  • 16 线雷达 @10 Hz:点量相对小,嵌入式可跑 LOAM 类
  • 128 线 / 固态高密度:需要特征提取或 ikd-tree / voxel map 增量结构
  • 图像 1280×800 @30 Hz:特征法中等,稠密直接法重

瓶颈经常在:

  • 点云拷贝与 ROS 序列化
  • 未增量的全局 ICP
  • 视觉穷搜描述子

架构上优先 增量地图结构 + 有界滑窗,而不是每帧对全图 ICP。

评测协议:避免「自嗨 Demo」

同一条轨迹上记录:

  1. 相对漂移:RPE @ 10 m / 50 m / 100 m
  2. 终点闭合 / 回环后 ATE
  3. 失败事件:跟踪丢失、退化报警触发
  4. 环境标签:是否长廊、是否强光、是否动态拥挤
  5. 传感器脏污注入测试(遮挡 10% 视场 / 喷雾)

没有环境标签的精度表没有决策价值。

决策流程(可放进设计评审)

text
1. 列出 Top 3 失效场景(场地实测)
2. 单传感器能否覆盖?不能则选互补传感器
3. 是否需要米制规划地图?→ 倾向 LiDAR/深度
4. 是否需要语义?→ 视觉必须在环
5. 算力/成本上限?
6. 标定与维护流程是否可执行?
7. 定义降级与急停策略
8. 用同一评测协议对比候选系统

小结

LiDAR 与视觉的深层差异是:

  • 观测流形不同(测距几何 vs 投影几何)
  • 退化场景互补(结构不足 vs 纹理/光照不足)
  • 融合价值在于填补不可观方向,而不是简单提高「平均精度」

选型时写清不可观自由度与失效安全,才是工程级方案;否则只是采购清单。

参考

尺度、外参、时间其中一项不对,后端再漂亮也像在拟合噪声。

  • Zhang & Singh, LOAM
  • Shan et al., LIO-SAM; Xu et al., FAST-LIO / FAST-LIO2
  • Zhang et al., On Degeneracy of Optimization-based State Estimation Problems
  • Cadena et al., Past, Present, and Future of Simultaneous Localization and Mapping (TRO survey)
← 全部文章

johan's blog