奖励黑客:高 return 离谱行为RL2026年7月8日·4 分钟阅读奖励黑客:高 return 离谱行为回报高但行为不对,先查 reward 是否漏约束;agent 会 exploit 仿真漏洞,不是单纯「还没训够」。#强化学习#奖励#安全READ →
稀疏奖励:先改任务再换算法RL2026年7月2日·3 分钟阅读稀疏奖励:先改任务再换算法大部分 step reward=0 时,credit assignment 像噪声;HER、curriculum、shaping 要选组合,纯 PPO 硬扛往往不经济。#强化学习#奖励#样本效率READ →
奖励塑形:势函数 shaping 为何相对安全RL2026年6月17日·4 分钟阅读奖励塑形:势函数 shaping 为何相对安全非势函数的额外 reward 可能改变最优策略;Ng et al. 的 potential-based shaping 在理论上保持最优策略不变。#强化学习#奖励#塑形READ →