首页 / 资讯中心 / 文章详情

RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【DDPG核心算法、数学推导】

RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【DDPG核心算法、数学推导】 ★ FEATURED ARTICLE
第四章 DDPG核心算法详解4.1 DDPG算法整体流程前面介绍了 DDPG 的网络结构:Actor负责生成连续动作;Critic负责评价动作价值;Target Network负责稳定训练;Replay Buffer负责提高数据利用率。从算法角度来看,DDPG实际上包含两个主要优化过程:Critic网络优化目标:Qw(s,a)→Qμ(s,a) Q_w(s,a)\rightarrow Q^\mu(s,a)Q
阅读完成 · 觉得有帮助?
咨询建站