稀疏奖励:先改任务再换算法
大部分 step reward=0 时,credit assignment 像噪声;HER、curriculum、shaping 要选组合,纯 PPO 硬扛往往不经济。

1. 百万步成功率仍为零
抓取放置只有成功加一、中间全零:随机策略几乎永远零回报,策略梯度方差极大。团队常把问题归因于算法,换近端策略优化调裁剪、换软 actor-critic 调熵系数,样本仍不经济。这不是「再训十倍步数」一定能解决——根本是 信用分配信号太稀。稀疏是任务设计问题,不是算法旋钮问题。随机都拿不到正回报时,换算法只是在零附近噪更久。
2. 优先级:任务先于算法
我的顺序:任务能否随机偶尔成功 → 能否 hindsight 经验回放或目标重标注 → 能否课程学习缩短 horizon → 再加势函数塑形 → 最后才换算法。纯近端策略优化硬扛稀疏抓取,往往样本不经济,不是裁剪调不对。手段包括 hindsight 经验回放、课程学习(缩短距离、放宽精度)、势函数塑形、行为克隆 warm start。离策略软 actor-critic 加经验回放比纯同策略稍吃稀疏,但根本还是信号问题。内在奖励我放更后:超参多、与外在奖励量纲难对齐。
3. 指标要对 sparse 友好
稀疏任务用 成功率 而非回合回报;回报方差大且常零。记录首次成功步数分布;中位数下降比平均回报更敏感。中间里程碑(接近目标距离小于阈值)作辅助指标,即使严格成功仍零,也知是否在进步。成功定义文档化(位姿误差小于阈值且保持若干步);改阈值等于改任务,学习曲线不可横比。辅助稠密指标仅用于日志,不作为部署成功判据。
4. 失败模式与放弃条件
塑形加太多,智能体刷塑形不完成任务。课程升太快,策略没巩固。评估用稀疏、训练用稠密却不说明。内在奖励与外在量纲不对齐,内在主导或完全看不见。放弃条件:一百万步成功率仍低于百分之一且随机非零,改任务而不是加倍步数。和产品经理对齐:稀疏是产品选择还是临时方案;若是永久,预算里要有 hindsight、课程或模仿学习之一,不是「多跑一夜」。
5. 案例:随机不可达
某长 horizon 装配任务,随机策略成功率绝对为零——初始与目标采样使任务对随机不可达。改初始与目标采样使随机偶尔成功(哪怕万分之一)后,hindsight 经验回放才开始有效。要检测成功率从百分之五到百分之十五,回合数要有统计功效,别用十条 claim。纯近端策略优化硬扛稀疏抓取,往往样本不经济,不是裁剪调不对。
6. 与 HER 和 curriculum
Hindsight 经验回放在目标条件任务上通常是性价比最高的第一步。课程学习缩短 horizon 要巩固后再升。内在奖励(随机网络蒸馏等)与外在量纲要对齐。Give up 条件:一百万步 success 仍低于百分之一且 random 非零,改 task 而不是加倍 timesteps。Eval 报告 success rate 与 return 分列,sparse 任务不以 return alone 判进展。
7. 验收
- Random policy success rate 应大于零;绝对为零则改 init/goal 采样。
- Eval 报告 success rate 与 return 分列。
- Auxiliary dense metric 仅用于 log。
- 对比 shaping vs HER 的 sample to success。
- 一百万步 success 仍 <1% 且 random 非零,改 task 而非加倍 timesteps。
先让 random 偶尔成功,再谈近端策略优化还是软 actor-critic。Random 都拿不到正 reward 时,换算法只是在零附近噪更久。
相关
也可以看看
johan's blog