LiDAR 与视觉 SLAM 的深层差异:几何、退化与融合可观性
从点到面 ICP、LOAM 特征、视觉尺度与场景退化模式出发,分析何时单传感器必然失败,以及松/紧耦合融合如何改变信息结构。

「雷达准、视觉便宜」是总结,不是分析。真正决定选型的是:测量模型、退化流形、外点机制,以及你准备用什么绝对信息钉住不可观自由度。
测量模型本质不同
1.1 视觉:投影几何
视觉观测是光线方向(加光度)。单目单帧深度不可观;深度来自:
- 多视图三角化
- 立体基线
- RGB-D
- IMU / 轮速尺度
误差主要来自:标定、匹配错误、曝光、运动模糊、滚动快门。
1.2 LiDAR:主动测距几何
机械式旋转雷达给出极坐标点;误差来自:
- 距离噪声(与反射率、距离相关)
- 光束发散
- 运动畸变(一帧扫描期间机体在动)
- 多径 / 透射(玻璃)
点云直接是米制,但结构退化时纵深不可观,这一点常被低估。
LiDAR 前端:不止是「ICP 一下」
2.1 点到面 / 点到线
经典点到面残差:
r = nᵀ ( R p + t - q )p 当前点,q 地图对应点,n 局部平面法向。比点到点 ICP 更抗采样密度变化。
LOAM 系进一步:
- 大曲率 → 角点(edge)→ 点到线
- 小曲率 → 平面点 → 点到面
这是在显式选择高信息几何特征,不是均匀用全部点。
2.2 运动畸变补偿
一帧扫描跨度 ΔT(如 100 ms)内,位姿连续变化。未去畸变时,墙壁会「弯」。
紧耦合 LIO(如 FAST-LIO)用 IMU 高频姿态对点云做去畸变,再做迭代卡尔曼 / 优化更新。视觉的「一帧曝光」更短,但 IMU 对 VIO 同样关键。
2.3 退化检测
对法向协方差 / 约束方向做 PCA:若特征值呈现「一个方向特别小」,说明该方向位移不可观(长廊)。
工程响应:
- 降低该方向的更新步长
- 引入轮速 / IMU / 视觉纹理约束
- 拒绝在退化方向做地图更新
没有退化检测的 LiDAR SLAM,在地下车库长直道会「滑行」。
视觉前端:特征法 vs 直接法(信息视角)
| 特征法 | 直接法 | |
|---|---|---|
| 残差 | 几何(重投影) | 光度 |
| 外点 | RANSAC / 鲁棒核 | 对曝光敏感 |
| 弱纹理 | 失效 | 亦失效,但可利用微小梯度 |
| 高速模糊 | 描述子崩 | 光度一致性崩 |
深层差异:特征法把图像压缩成稀疏路标,后端清晰;直接法信息量大但对辐射标定要求高。半直接(SVO 系)折中。
视觉的「纹理退化」≈ LiDAR 的「结构退化」,只是失效场景互补。
尺度、重力与绝对锚点
| 传感器组合 | 尺度 | 重力对齐 | 长期全局 |
|---|---|---|---|
| 单目 VO | 不可观 | 不可观 | 漂 |
| 双目 / RGB-D | 可观 | 弱 | 仍漂 |
| 单目 VIO | 可观(需激励) | 可观 | 仍漂 |
| LiDAR Odometry | 可观 | 需 IMU/地面假设 | 仍漂 |
| + 回环 | 相对全局 | — | 改善 |
| + GPS/UWB/磁钉 | 绝对 | — | 可锚定 |
结论:任何里程计都会漂;差别是漂的速度、方向,以及你用什么闭环/绝对观测把它钉住。
失效模式对照(用于方案评审)
5.1 视觉容易死在
- 暗光 / 强逆光
- 白墙、玻璃幕墙反射错匹配
- 动态行人占画面
- 镜头雾/污
- 夜景车灯拖影
5.2 LiDAR 容易死在
- 长廊、隧道、空旷广场(几何退化)
- 大雨雾雪(散射)
- 玻璃/黑车身(漏检或噪点)
- 正对强反光金属
- 多雷达外参漂移
5.3 两者都怕
- 时间同步错误
- 外参错误
- 剧烈冲击导致结构形变
- 无回环的超长轨迹
评审表不要写「雷达更稳」,要写「我们场地是否存在长廊退化?是否有玻璃?光照是否可控?」
融合:改的是信息矩阵,不是「加权平均轨迹」
6.1 松耦合
T_visual 与 T_lidar 作为相对位姿因子进入图。实现简单,但:
- 两套前端的相关性难建模
- 容易双计数同一几何(相机看到的墙与雷达扫到的墙)
6.2 紧耦合
同一状态上同时挂视觉残差与点到面残差(+ IMU)。信息利用充分,但工程复杂度高。
6.3 谁主导?
实用策略:
- 结构化室内物流:LiDAR(+IMU) 主导定位;视觉做识别/对接
- 高空 / 轻小平台:VIO 主导;必要时稀疏视觉重定位
- 地下车库:LiDAR+IMU,视觉辅助抗退化(纹理墙面)
- 对接充电桩:全局激光定位 + 近场视觉/红外标签
主导传感器决定失败安全策略:主传感器失效时是减速停,还是降级续航。
算力与数据率
粗算(数量级):
- 16 线雷达 @10 Hz:点量相对小,嵌入式可跑 LOAM 类
- 128 线 / 固态高密度:需要特征提取或 ikd-tree / voxel map 增量结构
- 图像 1280×800 @30 Hz:特征法中等,稠密直接法重
瓶颈经常在:
- 点云拷贝与 ROS 序列化
- 未增量的全局 ICP
- 视觉穷搜描述子
架构上优先 增量地图结构 + 有界滑窗,而不是每帧对全图 ICP。
评测协议:避免「自嗨 Demo」
同一条轨迹上记录:
- 相对漂移:RPE @ 10 m / 50 m / 100 m
- 终点闭合 / 回环后 ATE
- 失败事件:跟踪丢失、退化报警触发
- 环境标签:是否长廊、是否强光、是否动态拥挤
- 传感器脏污注入测试(遮挡 10% 视场 / 喷雾)
没有环境标签的精度表没有决策价值。
决策流程(可放进设计评审)
1. 列出 Top 3 失效场景(场地实测)
2. 单传感器能否覆盖?不能则选互补传感器
3. 是否需要米制规划地图?→ 倾向 LiDAR/深度
4. 是否需要语义?→ 视觉必须在环
5. 算力/成本上限?
6. 标定与维护流程是否可执行?
7. 定义降级与急停策略
8. 用同一评测协议对比候选系统小结
LiDAR 与视觉的深层差异是:
- 观测流形不同(测距几何 vs 投影几何)
- 退化场景互补(结构不足 vs 纹理/光照不足)
- 融合价值在于填补不可观方向,而不是简单提高「平均精度」
选型时写清不可观自由度与失效安全,才是工程级方案;否则只是采购清单。
参考
尺度、外参、时间其中一项不对,后端再漂亮也像在拟合噪声。
- Zhang & Singh, LOAM
- Shan et al., LIO-SAM; Xu et al., FAST-LIO / FAST-LIO2
- Zhang et al., On Degeneracy of Optimization-based State Estimation Problems
- Cadena et al., Past, Present, and Future of Simultaneous Localization and Mapping (TRO survey)
相关
也可以看看
johan's blog