Double DQN:减轻 max 过估计RL2026年6月20日·4 分钟阅读Double DQN:减轻 max 过估计标准 DQN 用 target 网在 \(s'\) 上 argmax 再取值,系统性高估;Double DQN 用 online 网选动作、target 网估值。#强化学习#DQN#过估计READ →
经验回放:打破样本相关RL2026年6月19日·3 分钟阅读经验回放:打破样本相关Replay buffer 让 off-policy 算法复用旧数据;容量、采样方式和 n-step 目标影响稳定性。#强化学习#DQN#经验回放READ →
探索:ε-greedy 之外还有什么RL2026年6月15日·4 分钟阅读探索:ε-greedy 之外还有什么高维连续空间里纯 ε-greedy 不够;entropy bonus、OU 噪声和 count-based 各适不同场景,探索不足表现为早收敛到次优。#强化学习#探索#DQNREAD →