有模型 RL:省样本但怕模型偏RL2026年7月7日·5 分钟阅读有模型 RL:省样本但怕模型偏学动力学做 imagined rollout 或 MPC;长 horizon 误差累积,短 horizon(MBPO)或 uncertainty 缓解。#强化学习#模型学习#样本效率READ →