更进一步地,有一个技巧,就是the advantage function由TD error近似:δ t = q t ( s t , a t ) − v t ( s t ) ⟹ δ t = r t + 1 + γ v t ( s t + 1 ) − v t ( s t ) \delta_t=q_t(s_t,a_t)-v_t(s_t) \Longrightarrow \delta_t=r_{t+1}+\gamma v_t(s_{t+1})-v_t(s_t)δ
阅读完成 · 觉得有帮助?