动作映射:tanh 之后还有一步RL2026年7月1日·3 分钟阅读动作映射:tanh 之后还有一步策略输出 [-1,1] 要线性映射到关节力矩/速度物理限位;scale 错等于隐式改 reward 和动力学。#强化学习#连续控制#动作空间READ →
观测归一化:连续控制默认项RL2026年6月30日·5 分钟阅读观测归一化:连续控制默认项关节角、速度、力矩量纲混在一起,MLP 很难学;running mean/std 归一化是 SB3 标配,train/eval 统计必须一致。#强化学习#预处理#连续控制READ →
TD3:在 DDPG 上打的三补丁RL2026年6月26日·5 分钟阅读TD3:在 DDPG 上打的三补丁Twin critic、delayed policy update、target policy smoothing,专治 Q 过估计和确定性策略外推。#强化学习#TD3#连续控制READ →
SAC:最大熵与自动温度RL2026年6月25日·5 分钟阅读SAC:最大熵与自动温度Soft Actor-Critic 同时最大化回报和策略熵;连续控制里常作 DDPG 的稳定替代。#强化学习#SAC#连续控制READ →
选 DQN 还是 PPO/SAC:看动作空间RL2026年6月14日·4 分钟阅读选 DQN 还是 PPO/SAC:看动作空间离散小动作空间可走 value-based;高维连续控制更常选 Actor-Critic 系,选错家族会浪费大量调参时间。#强化学习#算法选型#连续控制READ →