with-RL
강화 학습2024년 1월 17일

바닥부터 배우는 강화 학습 | 04. MDP를 알 때의 플래닝

'바닥부터 배우는 강화 학습' 4장에는 MDP를 알고 있는 경우 정책을 발전시키는 플래닝 방법에 대해서 설명하고 있습니다. 아래 내용은 공부하면서 핵심 내용을 정리한 것입니다.

참고자료

전제조건

4.1 밸류 평가하기 - 반복적 정책 평가

1. 테이블 초기화

2. 한 상태의 값을 업데이트

$$\begin{equation}
\begin{split}
v_{\pi}(s_5) = & 0.25 * (-1 + 0.0) + 0.25 * (-1 + 0.0) + \\
               & 0.25 * (-1 + 0.0) + 0.25 * (-1 + 0.0) = -1.0
\end{split}
\end{equation}$$

3. 모든 상태에 대해 2의 과정을 적용

4. 앞의 2 ~ 3 과정을 계속해서 반복

4.2 최고의 정책 찾기 - 정책 이터레이션

◈ 평가와 개선의 반복

◈ 과연 정책은 개선되는가?

◈ 정책 평가 부분을 간소화하기

4.3 최고의 정책 찾기 - 밸류 이터레이션

$$\begin{equation}
\begin{split}
v_{*}(s) &= \underset{a}{\mathrm{max}} \left [ r_s^a + \gamma \sum_{s' \in S} P_{ss'}^a v_{*}(s') \right ] \\
&= \mathrm{max}(-1 + 1.0 * 0, -1 + 1.0 * 0,  -1 + 1.0 * 0, -1 + 1.0 * 0,) \\
&= -1.0
\end{split}
\end{equation}$$

소스코드

아래 두 챕터의 내용을 직접 구현해 봤습니다.

https://github.com/with-rl/reinforcement-learning-from-basic/blob/main/ch_04.ipynb