奖励塑形:势函数 shaping 为何相对安全RL2026年6月17日·4 分钟阅读奖励塑形:势函数 shaping 为何相对安全非势函数的额外 reward 可能改变最优策略;Ng et al. 的 potential-based shaping 在理论上保持最优策略不变。#强化学习#奖励#塑形READ →