Q-learning 与 deadly triadRL2026年6月18日·4 分钟阅读Q-learning 与 deadly triad表格 Q-learning 收敛有保证;加函数近似和 off-policy 后,max 与 bootstrap 叠加可能不稳定。#强化学习#Q-learning#离策略READ →