返回专辑
·Johan·10 分钟阅读

离策略评估:部署前别只看行为数据上的平均回报

从重要性采样的支持集与方差出发,比较 self-normalized、per-decision、DR 和 FQE,并建立部署前的统计验收。

离策略评估:部署前别只看行为数据上的平均回报

1. 行为数据的平均回报回答错了问题

日志由行为策略 产生,直接平均回报估计的是 ,不能说明目标策略 可部署。离策略评估(OPE)要在不让 控制真实系统时估计

本文统一采用有限 horizon: 是最大决策步数;提前终止后补吸收状态,奖励为零,吸收动作在两策略下概率均为 1。价值模型的 默认包含时间和形成 Markov 状态所需的历史;无法充分压缩时, 直接以历史 为输入。

轨迹 来自 。完整决策上下文 应包含可见历史、action mask、策略版本、归一化统计及探索参数;只有它被 充分表示时才能把条件简写为 。日志须保存已执行动作在当时 下的 propensity。若初始分布、环境转移和奖励机制不因策略标签改变,则

于是普通 trajectory-wise importance sampling(IS)估计量是

IS 无偏要求:轨迹或 cluster 独立;propensity 是采样时真值;目标分布对行为分布绝对连续;初始分布与环境机制不变;无未建模的信息性删失;且 。此时 。事后拟合 一般失去有限样本无偏性。即便条件成立,长 horizon 的连乘仍可能让少数轨迹支配结果。

2. 支持集不满足时,估计器救不了部署决策

支持条件是目标轨迹分布对行为轨迹分布绝对连续:;逐步地,。离散动作下等价于 ;连续动作则要求密度关系几乎处处成立,不能谈单点概率。无覆盖时 likelihood ratio 不存在;密度极小时权重仍会爆炸。二者都是可识别性或方差问题,不能靠 clip threshold 修复。

上线前至少报告权重分位数、最大值与有效样本量

对 PDIS 和后面的 DR,还应按时刻计算累计权重

应报告 曲线、最小值和最终 ESS;它不是严格的“等价独立轨迹数”,但能暴露权重集中。覆盖还须按关键场景分层,避免容易场景掩盖安全关键状态的空洞。

动作边际频率不能替代 :全局常见动作在危险上下文仍可能无覆盖。若未存当时 propensity,拟合 必须作为 nuisance 模型处理,不能继续宣称普通 IS 有限样本无偏。

3. Self-normalized 与 per-decision 处理的是不同方差

Self-normalized IS(也叫 weighted IS)把权重除以样本内总和:

它有限样本有偏,也不能修复支持缺失;但在独立轨迹、绝对连续、 且分母不退化时,由大数定律一致收敛到 。使用估计 propensity 时还要求 nuisance 一致。

Trajectory-wise IS 要用整条轨迹的权重乘所有奖励,即便第 2 步奖励不依赖第 20 步动作。Per-decision IS(PDIS)只校正奖励发生前的动作:

在普通 IS 的已知 propensity、绝对连续和可积条件下,未归一化 PDIS 也无偏,因为第 个奖励只需校正此前动作。逐时归一化的 weighted PDIS 有限样本有偏,其一致性仍要求相应矩条件和正确分母。

变长 episode 应做 absorbing padding:每个 的分母包含全部 条轨迹,终止后奖励为零、累计 ratio 不变。若丢掉终止轨迹,只在存活 risk set 内归一化,通常得到存活条件奖励,而 需要含存活概率的无条件贡献。确需 risk-set estimand 时,必须另行识别存活概率并明确目标量。

4. 连续动作先辨清 density、变换与边界质量

连续动作的比率是相对于同一参考测度的条件密度。对可逆变换策略,应保存复算环境动作密度所需的信息,并在同一坐标计算两策略的 log_prob

实现时在 log 空间累加。因子化 Normal 要对 action 维求和;MultivariateNormal.log_prob 已是联合密度。若 ,则

不能把 bounded action 代回未变换 Normal。两策略变换完全相同时 Jacobian 在 ratio 中抵消;日志仍应保存 pre-tanh 或可稳定重建 transformed distribution 的参数。

硬 clipping 不可逆,会产生区间内部密度及边界点、面、角上的概率质量,是 mixed distribution。把 clipped action 代入普通 Gaussian log_prob 是错的。应计算诱导分布的内部密度与边界质量,或在两策略使用同一 clipping 映射时记录真实 pre-clip ,在 latent 空间算 ratio;边界动作无法反推出

若目标是 Dirac 确定性策略、行为策略对 Lebesgue 测度绝对连续,两者奇异,标准 IS 比率不存在。可定义有密度的部署策略、明确以 kernel relaxation 改变 estimand,或采用 FQE 并承认外推。log-sum-exp 只防溢出,不降低方差。

5. 截断权重是在显式购买偏差

工程实现常设 ,或逐步截断 。这样能限制极端样本对方差的影响,却改变了目标分布,因此通常引入偏差。阈值 越小,方差往往越低、偏差风险越高;不存在脱离数据分布的通用安全阈值。

应预先约定 threshold sweep,同时给出不截断、多个 、ESS、最大权重和区间。若结论随阈值改变方向,证据不足;逐步 clip 与 trajectory clip 也必须区分。

高权重若来自稀有但关键的状态,clip 正会压低其贡献。应分层判断是概率记录错误、版本错配,还是策略距离过远;后者要收窄更新或补采安全探索数据,而非继续调估计器。

6. DR 与 FQE 用模型换取更低方差

Doubly Robust(DR)用重要性权重校正价值模型的 Bellman 残差。有限 horizon 下令 ,且 ;共享网络必须输入 或剩余 horizon。

表示已知 propensity;否则它是未使用当前评估轨迹训练的交叉拟合 。定义 ,则

真实 已知且价值模型独立拟合或 cross-fit 时,DR 在支持和可积条件下对任意价值模型保留 IS 的无偏性,较准的模型负责降方差。使用 时,一致性可来自 propensity 模型正确,或整组 正确;还需 overlap、正则性和非退化分母。渐近推断通常进一步要求两侧 nuisance 误差乘积足够快趋零。cross-fitting 必须按完整轨迹或 cluster 分割。

FQE 不用完整轨迹权重。有限 horizon 下固定 ,令 ,从 向前拟合

最后在初始状态上平均 。可用输入 的共享网络;离散动作求和,连续动作常从 采样。

terminated 才把下一状态价值置零。若采集时间上限不是 estimand 的 truncated 应从下一状态 bootstrap,或作为删失问题建模;只有评估契约本身结束时才令

FQE 一致性要求行为数据覆盖目标状态动作区域,且函数类满足 realizability 或相应 Bellman completeness/投影误差控制;回归优化和目标动作期望也须准确。行为分布上的低 held-out Bellman error 不证明目标占用分布上的价值正确,因此要报告覆盖、分布外 action 及函数类敏感性。

三者无需数值相同:IS 假设少但方差高,FQE 方差低但模型假设强,DR 检查基线加残差修正。若趋势冲突,应诊断覆盖与外推,不能对三个数取平均。

7. 置信区间的采样单位是 trajectory

同一轨迹内 step 强相关,bootstrap 必须有放回抽取整条轨迹;存在用户、车辆或设备内相关时,抽样单位上升到 cluster。

每个 replicate 都要重拟合 、重做 DR cross-fitting、重训 backward FQE,并重算归一化分母;固定原始 nuisance 只重算末端公式会漏掉训练不确定性。函数类、超参数和 clip threshold 应在外层预先固定,cross-fitting 仍按轨迹或 cluster 隔离。

重尾或低 ESS 可使区间多峰;所需矩不存在时,普通 n-out-of-n bootstrap 甚至没有渐近覆盖保证。应展示重采样分布。Lower confidence bound 只有在理论条件可辩护且仿真覆盖率合格时才可作门槛,仿真也不能证明生产覆盖率。

同一数据反复筛策略会产生选择偏差。应分离选择集与确认集;预处理、行为模型、FQE 超参和 clip threshold 都在揭盲前固定。

8. 用仿真 A/B 校准整条 OPE 管线

先在可 rollout 的仿真中改变策略距离、horizon、奖励稀疏度与行为噪声,用独立目标策略 rollout 作 Monte Carlo 参照,重复测偏差、均方误差、区间覆盖率和决策错误。

OPE 只看行为轨迹和 propensity,目标 rollout 事后揭示真值。若生产尺度下 ESS 崩溃,结论应是“日志不能回答问题”,而非换估计器。

进入真实系统时,验收应同时满足:

  • 完整决策上下文、策略版本、action mask、分布参数、latent 与执行动作可关联,离散 propensity 或连续/mixed likelihood 能复算;
  • 目标策略满足 ,按关键场景报告 ratio、trajectory weight、逐时 、最终 ESS 和覆盖缺口;
  • IS、SNIS、PDIS、DR/FQE 的假设与敏感性并列,clip 阈值预先固定;
  • 有限 horizon、absorbing padding、时间状态、terminated/truncated 语义在所有估计器中一致;
  • 区间按 trajectory 或更高层 cluster 构造,每次重训 nuisance/FQE,候选选择与最终确认数据隔离;
  • 仿真验证区间覆盖和决策规则后,才进行带硬安全约束的小流量 online A/B;
  • 门槛同时约束回报下界与安全指标。

“现有数据无法以可接受方差区分策略”也是可执行结论:缩小更新、补采有支持的数据、改善 propensity 后再评估。部署前应先证明覆盖,再用 IS 系列、DR/FQE 与校准区间共同约束决策。

相关

也可以看看

← 全部文章

johan's blog