with-RL
강화 학습2024년 1월 18일

바닥부터 배우는 강화 학습 | 06. MDP를 모를 때 최고의 정책 찾기

'바닥부터 배우는 강화 학습' 6장에는 MDP를 모르고 있는 경우 최고의 정책을 찾는 방법에 대해서 설명하고 있습니다. 아래 내용은 공부하면서 핵심 내용을 정리한 것입니다.

참고자료

6.1 몬테카를로 컨트롤

◈ 정책 이터레이션을 그대로 사용할 수 없는 이유

$$v_{\pi}(s) = \sum_{a \in A} \pi(a|s) \left( r_s^a + \gamma \sum_{s' \in S} P_{ss'}^a v_{\pi}(s') \right)$$

◈ 해결 방법

1. 평가 자리에 MC

2. V 대신 Q

3. greedy 대신 $\epsilon$ - greedy

$$\pi(a|s)=
\begin{cases}
1 - \epsilon, & \mbox{if } a* = \underset{a}{\mathrm{argmax}} \; q(s, a) \\
\epsilon, & \text{otherwise}
\end{cases}$$

◈ 몬테카를로 컨트롤 구현

6.2 TD 컨트롤 1 - SARSA

◈ MC 대신 TD

◈ SARSA 구현

이 부분은 구현에 대한 코드가 설명되어 있습니다.

6.3 TD 컨트롤 2 - Q러닝

◈ Off-Policy와 On-Policy

◈ Off-policy 학습의 장점

1 과거의 경험을 재사용할 수 있다

2 사람의 데이터로부터 학습할 수 있다

3 일대다, 다대일 학습이 가능하다

◈ Q러닝의 이론적 배경 - 벨만 최적 방정식

SARSAQ러닝
행동정책
(Behavior Policy)
Q에 대해
$\epsilon$-Greedy
Q에 대해
$\epsilon$-Greedy
타깃 정책
(Target Policy)
Q에 대해
$\epsilon$-Greedy
Q에 대해
Greedy

◈ Q러닝 구현

이 부분은 구현에 대한 코드가 설명되어 있습니다.