有模型 RL:省样本但怕模型偏RL2026年7月7日·5 分钟阅读有模型 RL:省样本但怕模型偏学动力学做 imagined rollout 或 MPC;长 horizon 误差累积,短 horizon(MBPO)或 uncertainty 缓解。#强化学习#模型学习#样本效率READ →
稀疏奖励:先改任务再换算法RL2026年7月2日·3 分钟阅读稀疏奖励:先改任务再换算法大部分 step reward=0 时,credit assignment 像噪声;HER、curriculum、shaping 要选组合,纯 PPO 硬扛往往不经济。#强化学习#奖励#样本效率READ →