AWAC 优势加权行为克隆:温度把坏动作压住之后RL2026年7月30日·19 分钟阅读AWAC 优势加权行为克隆:温度把坏动作压住之后从优势加权策略更新与离线约束出发,说明温度/权重截断如何决定保守程度;对比纯 BC、AWR 与 AWAC,用离线数据集上的回报与动作 KL 验收。#强化学习#离线强化学习#AWAC#行为克隆READ →