离线 RL:不能交互时别信外推
只有固定日志、不能再采新数据时,naive Q-learning 会对 OOD 动作给出虚高 Q;CQL、IQL 等抑制外推。

1. 离线指标高,真机一步就崩
真机或人类示范数据集往往 只能批量使用:不能再在线探索。用标准深度 Q 网络或软 actor-critic 在日志上继续训,对状态上所有动作取最大 Q,会选中数据里没出现过的动作,Q 虚高,部署必崩。训练 Q 在 held-out state 上极高、behavior policy 上极低——离线指标骗人。Release 前 offline policy 必须 online A/B:哪怕只有五十条 real episodes,也能抓 OOD action。
2. 机制:抑制分布外外推
保守 Q 学习:加惩罚项压低分布外动作的 Q,使学到的 Q 在数据支持集内保守。隐式 Q 学习:用 expectile regression 估 value,避免显式 max over actions。Some offline methods 加 KL penalty 让 learned policy 接近 behavior policy。CQL conservative coefficient 太大 policy 塌成 behavior clone,太小仍 OOD。IQL expectile τ 调高更 optimistic。Offline 数据集 time index 和 action delay 要对齐;错位一步,Q 学的是错误 dynamics。
3. 数据集比算法更常是瓶颈
D4RL benchmark 里,medium-expert 和 random 混合数据训出的策略天差地别。我在只有五十条 human demo 时,先 行为克隆 看能否复现 demo 动作,再上 CQL/IQL;若 BC 都拟合不了,离线 RL 期望要放低。数据覆盖要好:状态-动作支持集广。纯 expert 无 suboptimal 混合,可能学不到 recovery。Suboptimal data 有时比 pure expert 更好——含 recovery behavior。Offline RL 不能创造数据里没有的行为。
4. 部署门禁与评估
Hold-out trajectories(不是单点 transition)评估;整条 traj OOD 比单点 OOD 更贴 deploy。部署前必须 online smoke test:离线指标再高,第一次真交互也可能选到数据没见过的动作组合。Hold-out state-action 上的 Q 应该和 behavior action 的 Q 接近;若 learned policy 的 action 处 Q 远高于 behavior,部署危险。Behavior cloning 基线:若 BC 都不行,离线 RL 也难 miracles。Deployment gate:offline eval + 100 step online sanity。
5. 案例:五十条 demo
某机械臂任务只有五十条 human demo,先 BC 看 held-out action MSE;BC 拟合不了时,CQL 也不指望 miracles。BC 能复现后再上 CQL,conservative coefficient 从默认逐步调。数据若只含 narrow expert,学出的 policy recovery 能力有限。Fine-tune 数据少时用 BC on real 初始化再 RL,比 pure RL sample 省。Offline normalized score 高不能替代 online 验证。
6. Behavior regularization
Some offline methods 加项让 learned policy 接近 behavior policy(KL penalty),防止选 OOD action。Eval 用 learned policy online 一次就撞限位——离线指标骗人。若有条件,少量 online fine-tune 验证。数据里 done 和 reward 定义与部署 env 一致。CQL 的 conservative term 和 BC regularization 可同时存在。
数据里 done 和 reward 定义与部署 env 一致。CQL 的 conservative term 和 BC regularization 可同时存在。Eval 用 learned policy online 一次就撞限位——离线指标骗人。若有条件,少量 online fine-tune 验证。Hold-out trajectories 评估比单点 transition 更贴 deploy。Offline normalized score 高不能替代 online 验证。Suboptimal data 有时比 pure expert 更好——含 recovery behavior。
7. 真机日志与部署门禁
真机或人类示范日志往往不能再在线探索,这是离线强化学习的典型场景。数据集里时间戳与动作延迟要对齐,错位一步价值函数学的是错误动力学。只有专家数据、没有次优混合时,策略学不会恢复行为;含次优轨迹的数据有时比纯专家更好。部署前哪怕只有五十条真机在线试跑,也能抓住分布外动作——离线归一化分数再高也不能替代。行为克隆基线拟合不了时,保守 Q 学习也别指望奇迹,先扩数据再调算法。
8. 验收
- 先训 BC 看 held-out action MSE。
- 离线 RL 在 D4RL 类 benchmark 上对比 normalized score。
- CQL/IQL 系数 ablation:policy 不应塌成纯 clone,也不应 OOD 虚高。
- 100 step online sanity test 通过后再部署。
- 数据 done 和 reward 定义与部署 env 一致。
离线 RL 的核心约束是「不能外推」。BC 基线都不行时,CQL 也难 miracles——先扩数据,再调算法。部署前一百步在线 sanity test 通过后再全量部署,比只看离线分数可靠。Hold-out 轨迹评估比单点 transition 更贴真机部署;整条轨迹分布外比单点分布外更危险。保守 Q 学习系数过大策略塌成行为克隆,太小仍分布外虚高,要做 ablation。
相关
也可以看看
- ·16 分钟阅读
约束 MDP 的代价估计偏差:安全层看起来在工作
区分期望约束、条件风险与硬屏蔽,解释代价 critic 偏差如何让可行集虚胖;用约束违反轨迹占比、拉格朗日乘子轨迹和安全层旁路注入验收。
- ·17 分钟阅读
离线强化学习的支持集外动作:为什么 Q 值会自我抬高
从 Bellman backup 的分布外 maximization 解释外推误差;比较行为约束、保守价值与策略正则,并用覆盖率切片与 FQE 交叉验证部署边界。
- ·10 分钟阅读
离策略评估:部署前别只看行为数据上的平均回报
从重要性采样的支持集与方差出发,比较 self-normalized、per-decision、DR 和 FQE,并建立部署前的统计验收。
johan's blog