
·3 分钟阅读
TimeLimit 不是终止:bootstrap 要看 terminated
用 Gymnasium 的 terminated/truncated 分离重置条件与价值边界,并处理 replay、GAE 和自动重置环境里的最后观测。
READ →

·5 分钟阅读
Q 过估计:从 Double DQN 到 twin critic
max Q 和 bootstrap 叠加系统性高估未见动作;Double DQN、TD3/SAC 的 min Q、离线 CQL 都在治同一偏误。
READ →

·3 分钟阅读
Actor-Critic:两个网络各干什么
Critic 估 \(V\) 或 \(Q\) 给 Actor 提供低方差信号;critic 不准会把 policy 带偏。
READ →

·5 分钟阅读
策略梯度:REINFORCE 与方差
直接优化 \(\mathbb{E}[G_t \nabla \log \pi_\theta]\);完整轨迹 return 方差随 horizon 爆炸,baseline 和 critic 是刚需。
READ →

·4 分钟阅读
Q-learning 与 deadly triad
表格 Q-learning 收敛有保证;加函数近似和 off-policy 后,max 与 bootstrap 叠加可能不稳定。
READ →




































