离线强化学习的支持集外动作:为什么 Q 值会自我抬高RL2026年7月28日·17 分钟阅读离线强化学习的支持集外动作:为什么 Q 值会自我抬高从 Bellman backup 的分布外 maximization 解释外推误差;比较行为约束、保守价值与策略正则,并用覆盖率切片与 FQE 交叉验证部署边界。#强化学习#离线RL#分布外#Q学习READ →