离策略评估:部署前别只看行为数据上的平均回报
从重要性采样的支持集与方差出发,比较 self-normalized、per-decision、DR 和 FQE,并建立部署前的统计验收。

1. 行为数据的平均回报回答错了问题
日志由行为策略 产生,直接平均回报估计的是 ,不能说明目标策略 可部署。离策略评估(OPE)要在不让 控制真实系统时估计
本文统一采用有限 horizon: 是最大决策步数;提前终止后补吸收状态,奖励为零,吸收动作在两策略下概率均为 1。价值模型的 默认包含时间和形成 Markov 状态所需的历史;无法充分压缩时, 直接以历史 为输入。
轨迹 来自 。完整决策上下文 应包含可见历史、action mask、策略版本、归一化统计及探索参数;只有它被 充分表示时才能把条件简写为 。日志须保存已执行动作在当时 下的 propensity。若初始分布、环境转移和奖励机制不因策略标签改变,则
于是普通 trajectory-wise importance sampling(IS)估计量是
IS 无偏要求:轨迹或 cluster 独立;propensity 是采样时真值;目标分布对行为分布绝对连续;初始分布与环境机制不变;无未建模的信息性删失;且 。此时 。事后拟合 一般失去有限样本无偏性。即便条件成立,长 horizon 的连乘仍可能让少数轨迹支配结果。
2. 支持集不满足时,估计器救不了部署决策
支持条件是目标轨迹分布对行为轨迹分布绝对连续:;逐步地,。离散动作下等价于 ;连续动作则要求密度关系几乎处处成立,不能谈单点概率。无覆盖时 likelihood ratio 不存在;密度极小时权重仍会爆炸。二者都是可识别性或方差问题,不能靠 clip threshold 修复。
上线前至少报告权重分位数、最大值与有效样本量
对 PDIS 和后面的 DR,还应按时刻计算累计权重 的
应报告 曲线、最小值和最终 ESS;它不是严格的“等价独立轨迹数”,但能暴露权重集中。覆盖还须按关键场景分层,避免容易场景掩盖安全关键状态的空洞。
动作边际频率不能替代 :全局常见动作在危险上下文仍可能无覆盖。若未存当时 propensity,拟合 必须作为 nuisance 模型处理,不能继续宣称普通 IS 有限样本无偏。
3. Self-normalized 与 per-decision 处理的是不同方差
Self-normalized IS(也叫 weighted IS)把权重除以样本内总和:
它有限样本有偏,也不能修复支持缺失;但在独立轨迹、绝对连续、、 且分母不退化时,由大数定律一致收敛到 。使用估计 propensity 时还要求 nuisance 一致。
Trajectory-wise IS 要用整条轨迹的权重乘所有奖励,即便第 2 步奖励不依赖第 20 步动作。Per-decision IS(PDIS)只校正奖励发生前的动作:
在普通 IS 的已知 propensity、绝对连续和可积条件下,未归一化 PDIS 也无偏,因为第 个奖励只需校正此前动作。逐时归一化的 weighted PDIS 有限样本有偏,其一致性仍要求相应矩条件和正确分母。
变长 episode 应做 absorbing padding:每个 的分母包含全部 条轨迹,终止后奖励为零、累计 ratio 不变。若丢掉终止轨迹,只在存活 risk set 内归一化,通常得到存活条件奖励,而 需要含存活概率的无条件贡献。确需 risk-set estimand 时,必须另行识别存活概率并明确目标量。
4. 连续动作先辨清 density、变换与边界质量
连续动作的比率是相对于同一参考测度的条件密度。对可逆变换策略,应保存复算环境动作密度所需的信息,并在同一坐标计算两策略的 log_prob:
实现时在 log 空间累加。因子化 Normal 要对 action 维求和;MultivariateNormal.log_prob 已是联合密度。若 ,则
不能把 bounded action 代回未变换 Normal。两策略变换完全相同时 Jacobian 在 ratio 中抵消;日志仍应保存 pre-tanh 或可稳定重建 transformed distribution 的参数。
硬 clipping 不可逆,会产生区间内部密度及边界点、面、角上的概率质量,是 mixed distribution。把 clipped action 代入普通 Gaussian log_prob 是错的。应计算诱导分布的内部密度与边界质量,或在两策略使用同一 clipping 映射时记录真实 pre-clip ,在 latent 空间算 ratio;边界动作无法反推出 。
若目标是 Dirac 确定性策略、行为策略对 Lebesgue 测度绝对连续,两者奇异,标准 IS 比率不存在。可定义有密度的部署策略、明确以 kernel relaxation 改变 estimand,或采用 FQE 并承认外推。log-sum-exp 只防溢出,不降低方差。
5. 截断权重是在显式购买偏差
工程实现常设 ,或逐步截断 。这样能限制极端样本对方差的影响,却改变了目标分布,因此通常引入偏差。阈值 越小,方差往往越低、偏差风险越高;不存在脱离数据分布的通用安全阈值。
应预先约定 threshold sweep,同时给出不截断、多个 、ESS、最大权重和区间。若结论随阈值改变方向,证据不足;逐步 clip 与 trajectory clip 也必须区分。
高权重若来自稀有但关键的状态,clip 正会压低其贡献。应分层判断是概率记录错误、版本错配,还是策略距离过远;后者要收窄更新或补采安全探索数据,而非继续调估计器。
6. DR 与 FQE 用模型换取更低方差
Doubly Robust(DR)用重要性权重校正价值模型的 Bellman 残差。有限 horizon 下令 ,且 ;共享网络必须输入 或剩余 horizon。
记 表示已知 propensity;否则它是未使用当前评估轨迹训练的交叉拟合 。定义 ,则
真实 已知且价值模型独立拟合或 cross-fit 时,DR 在支持和可积条件下对任意价值模型保留 IS 的无偏性,较准的模型负责降方差。使用 时,一致性可来自 propensity 模型正确,或整组 正确;还需 overlap、正则性和非退化分母。渐近推断通常进一步要求两侧 nuisance 误差乘积足够快趋零。cross-fitting 必须按完整轨迹或 cluster 分割。
FQE 不用完整轨迹权重。有限 horizon 下固定 ,令 ,从 向前拟合
最后在初始状态上平均 。可用输入 的共享网络;离散动作求和,连续动作常从 采样。
terminated 才把下一状态价值置零。若采集时间上限不是 estimand 的 ,truncated 应从下一状态 bootstrap,或作为删失问题建模;只有评估契约本身结束时才令 。
FQE 一致性要求行为数据覆盖目标状态动作区域,且函数类满足 realizability 或相应 Bellman completeness/投影误差控制;回归优化和目标动作期望也须准确。行为分布上的低 held-out Bellman error 不证明目标占用分布上的价值正确,因此要报告覆盖、分布外 action 及函数类敏感性。
三者无需数值相同:IS 假设少但方差高,FQE 方差低但模型假设强,DR 检查基线加残差修正。若趋势冲突,应诊断覆盖与外推,不能对三个数取平均。
7. 置信区间的采样单位是 trajectory
同一轨迹内 step 强相关,bootstrap 必须有放回抽取整条轨迹;存在用户、车辆或设备内相关时,抽样单位上升到 cluster。
每个 replicate 都要重拟合 、重做 DR cross-fitting、重训 backward FQE,并重算归一化分母;固定原始 nuisance 只重算末端公式会漏掉训练不确定性。函数类、超参数和 clip threshold 应在外层预先固定,cross-fitting 仍按轨迹或 cluster 隔离。
重尾或低 ESS 可使区间多峰;所需矩不存在时,普通 n-out-of-n bootstrap 甚至没有渐近覆盖保证。应展示重采样分布。Lower confidence bound 只有在理论条件可辩护且仿真覆盖率合格时才可作门槛,仿真也不能证明生产覆盖率。
同一数据反复筛策略会产生选择偏差。应分离选择集与确认集;预处理、行为模型、FQE 超参和 clip threshold 都在揭盲前固定。
8. 用仿真 A/B 校准整条 OPE 管线
先在可 rollout 的仿真中改变策略距离、horizon、奖励稀疏度与行为噪声,用独立目标策略 rollout 作 Monte Carlo 参照,重复测偏差、均方误差、区间覆盖率和决策错误。
OPE 只看行为轨迹和 propensity,目标 rollout 事后揭示真值。若生产尺度下 ESS 崩溃,结论应是“日志不能回答问题”,而非换估计器。
进入真实系统时,验收应同时满足:
- 完整决策上下文、策略版本、action mask、分布参数、latent 与执行动作可关联,离散 propensity 或连续/mixed likelihood 能复算;
- 目标策略满足 ,按关键场景报告 ratio、trajectory weight、逐时 、最终 ESS 和覆盖缺口;
- IS、SNIS、PDIS、DR/FQE 的假设与敏感性并列,clip 阈值预先固定;
- 有限 horizon、absorbing padding、时间状态、
terminated/truncated语义在所有估计器中一致; - 区间按 trajectory 或更高层 cluster 构造,每次重训 nuisance/FQE,候选选择与最终确认数据隔离;
- 仿真验证区间覆盖和决策规则后,才进行带硬安全约束的小流量 online A/B;
- 门槛同时约束回报下界与安全指标。
“现有数据无法以可接受方差区分策略”也是可执行结论:缩小更新、补采有支持的数据、改善 propensity 后再评估。部署前应先证明覆盖,再用 IS 系列、DR/FQE 与校准区间共同约束决策。
相关
也可以看看
- ·16 分钟阅读
约束 MDP 的代价估计偏差:安全层看起来在工作
区分期望约束、条件风险与硬屏蔽,解释代价 critic 偏差如何让可行集虚胖;用约束违反轨迹占比、拉格朗日乘子轨迹和安全层旁路注入验收。
- ·17 分钟阅读
离线强化学习的支持集外动作:为什么 Q 值会自我抬高
从 Bellman backup 的分布外 maximization 解释外推误差;比较行为约束、保守价值与策略正则,并用覆盖率切片与 FQE 交叉验证部署边界。
- ·3 分钟阅读
TimeLimit 不是终止:bootstrap 要看 terminated
用 Gymnasium 的 terminated/truncated 分离重置条件与价值边界,并处理 replay、GAE 和自动重置环境里的最后观测。
johan's blog