PPO 裁剪:限制策略一步走多远RL2026年6月24日·5 分钟阅读PPO 裁剪:限制策略一步走多远Clipped surrogate 近似 trust region,实现比 TRPO 简单;ε、entropy coef 和 value loss 权重是主要旋钮。#强化学习#PPO#策略READ →
GAE:优势估计的 λ 旋钮RL2026年6月23日·5 分钟阅读GAE:优势估计的 λ 旋钮广义优势估计在 TD(0) 和 Monte Carlo 之间插值;PPO 里 advantage 质量直接决定更新方向。#强化学习#PPO#优势READ →
Actor-Critic:两个网络各干什么RL2026年6月22日·3 分钟阅读Actor-Critic:两个网络各干什么Critic 估 \(V\) 或 \(Q\) 给 Actor 提供低方差信号;critic 不准会把 policy 带偏。#强化学习#Actor-Critic#PPOREAD →