Q 过估计:从 Double DQN 到 twin criticRL2026年7月12日·5 分钟阅读Q 过估计:从 Double DQN 到 twin criticmax Q 和 bootstrap 叠加系统性高估未见动作;Double DQN、TD3/SAC 的 min Q、离线 CQL 都在治同一偏误。#强化学习#Q-learning#过估计READ →
Double DQN:减轻 max 过估计RL2026年6月20日·4 分钟阅读Double DQN:减轻 max 过估计标准 DQN 用 target 网在 \(s'\) 上 argmax 再取值,系统性高估;Double DQN 用 online 网选动作、target 网估值。#强化学习#DQN#过估计READ →