第四章 DDPG核心算法详解4.1 DDPG算法整体流程前面介绍了 DDPG 的网络结构:Actor负责生成连续动作;Critic负责评价动作价值;Target Network负责稳定训练;Replay Buffer负责提高数据利用率。从算法角度来看,DDPG实际上包含两个主要优化过程:Critic网络优化目标:Qw(s,a)→Qμ(s,a) Q_w(s,a)\rightarrow Q^\mu(s,a)Q
阅读完成 · 觉得有帮助?