
·5 分钟阅读
Q 过估计:从 Double DQN 到 twin critic
max Q 和 bootstrap 叠加系统性高估未见动作;Double DQN、TD3/SAC 的 min Q、离线 CQL 都在治同一偏误。
READ →

max Q 和 bootstrap 叠加系统性高估未见动作;Double DQN、TD3/SAC 的 min Q、离线 CQL 都在治同一偏误。
READ →

表格 Q-learning 收敛有保证;加函数近似和 off-policy 后,max 与 bootstrap 叠加可能不稳定。
READ →