RL-赵-(十)-Actor-Critic02:Actor-Critic离线算法【将算法从on转为off:利用已有的分布为p1的采样{x}样本通过“重要性采样”来计算分布为p0时的期望值】到目前为止AC的方法还有policy gradient方法都是on-policy的。如果之前有一些经验了 我们想用这些经验该怎么办呢?我们可以用off-policy的actor-critic的方法。Policy gradient是on-policy,因为梯度
阅读完成 · 觉得有帮助?