with-RL
강화 학습2024년 1월 17일

바닥부터 배우는 강화 학습 | 02. 마르코프 결정 프로세스

'바닥부터 배우는 강화 학습' 2장에는 중요한 기본 개념들을 설명하고 있습니다. 예전에 혼란스러웠던 내용인데 명쾌하게 잘 설명이 돼있습니다. 아래 내용은 공부하면서 핵심 내용을 정리한 것입니다.

참고자료

2.1 마르코프 프로세스 (Markov Process)

◈ 아이가 잠이 드는 마르코프 프로세스

◈ 마르코프 성질

◈ 마르코프 한 상태

◈ 마르코프 하지 않은 상태

2.2 마르코프 리워드 프로세스 (Markov Reward Processes)

마르코프 프로세스에 보상의 개념이 추가되면 마르코프 리워드 프로세스(Markov Reward Process)

◈ 아이가 잠이 드는 MRP

◈ 감쇠된 보상의 합, 리턴

◈ $\gamma$는 왜 필요할까?

수학적 편리성

사람의 선호 반영

미래에 대한 불확실성 반영

◈ MRP에서 각 상태의 밸류 평가하기

◈ 에피소드의 샘플링

◈ 상태 가치 함수 (State Value Function)

2.3 마르코프 결정 프로세스(Markov Decision Process)

마르코프 결정 프로세스(Markov Decision Process)는 순차적 의사 결정의 핵심인 의사결정(decision)에 관한 부분을 포함

◈ MDP의 정의

◈ 아이 재우기 MDP

◈ 정책 함수와 2가지 가치 함수

정책 함수

상태 가치 함수

$$\begin {matrix}
v_{\pi}(s) &=& \mathbb {E_{\pi}} [r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} +... | S_t = s] \\
       &=& \mathbb {E_{\pi}}[G_t|S_t = s]
\end {matrix}$$

액션 가치 함수

$$q_{\pi}(s, a) = \mathbb {E}[G_t|S_t = s, A_t = a]$$

2.4 Prediction과 Control