经验回放:打破样本相关RL2026年6月19日·3 分钟阅读经验回放:打破样本相关Replay buffer 让 off-policy 算法复用旧数据;容量、采样方式和 n-step 目标影响稳定性。#强化学习#DQN#经验回放READ →