ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

RL-赵-(七)-不基于模型2-时序差分/TD算法04-计算ActionValue:n-step Sarsa【折中①one-step Sarsa与②∞-step MC:采样n步然后更新π】

RL-赵-(七)-不基于模型2-时序差分/TD算法04-计算ActionValue:n-step Sarsa【折中①one-step Sarsa与②∞-step MC:采样n步然后更新π】 RL-赵-(七)-不基于模型4:n-step Sarsa【TD算法】【Sarsa与MC的折中形式:采样n步就更新π】【Sarsa只需要一步的数据就更新;MC需等到一个episode数据搜集结束再更新】n-Step Sarsa是Sarsa的一个变型或者是一个推广,因为n-step Sarsa包含了Sarsa和蒙特卡洛两种方法,也就是can unify Sarsa and Monte Carlo learning。Action Value的定义如下:q π ( s , a ) = E [ G t ∣ S t = s , A t = a ] q_\pi(s,a)=\mathbb{E}[G_t|S_t=s,A_t=a]qπ​(s,a)=E[Gt​∣St​=s,At​=a]其中的 discounted returnG t G_tGt​有很多种写法【G t ( 1 ) G_t^{(1)}Gt(1)​表示第一种写法,G t ( n ) G_t^{(n)}Gt(n)​表示第n nn中写法】:Sarsa ⟵ G t ( 1 ) = R t + 1 + γ q π ( S t + 1 , A t + 1 ) , 【第 t + 1 时间步后的所有 r e w a r d 都汇总到 q π ( S t + 1 , A t + 1 ) 】 G t ( 2 ) = R t + 1 + γ R t + 2 + γ 2 q π ( S t + 2 , A t + 2 ) , 【第 t + 2 时间步后的所有 r e w a r d 都汇总到 q π ( S t + 2 , A t + 2 ) 】 : n -stepSarsa ⟵ G t ( n ) = R t + 1 + γ R t + 2 + ⋯ + γ n q π ( S t + n , A t + n ) , 【第 t + n 时间步后的所有 r e w a r d 都汇总到 q π ( S t + n , A t + n ) 】 MC ⟵ G t ( ∞ ) = R t + 1 + γ R t + 2 + γ 2 R t + 3 + … \begin{aligned} \text{Sarsa}\longleftarrow G_t^{(1)} =R_{t+1}+\gamma q_{\pi}(S_{t+1},A_{t+1}), 【第t+1时间步后的所有reward都汇总到q_{\pi}(S_{t+1},A_{t+1})】\\ G_{t}^{(2)} =R_{t+1}+\gamma R_{t+2}+\gamma^2q_\pi(S_{t+2},A_{t+2}), 【第t+2时间步后的所有reward都汇总到q_{\pi}(S_{t+2},A_{t+2})】\\ \text{:} \\ n\text{-step Sarsa}\longleftarrow G_t^{(n)} =R_{t+1}+\gamma R_{t+2}+\cdots+\gamma^nq_\pi(S_{t+n},A_{t+n}), 【第t+n时间步后的所有reward都汇总到q_{\pi}(S_{t+n},A_{t+n})】 \\ \text{MC}\longleftarrow G_t^{(\infty)} =R_{t+1}+\gamma R_{t+2}+\gamma^{2}R_{t+3}+\ldots \end{aligned}Sarsa⟵Gt(1)​Gt(2)​:n-stepSarsa⟵Gt(n)​MC⟵Gt(∞)​​=Rt+1​+γqπ​(St+1​,At+1​),【第t+1时间步后的所有reward都汇总到qπ​(St+1​,At+1​)】=Rt+1​+γRt+2​+γ
返回列表