with-RL
강화 학습2024년 1월 18일

바닥부터 배우는 강화 학습 | 07. Deep RL 첫 걸음

'바닥부터 배우는 강화 학습' 7장에는 무수히 많은 MDP를 풀기 위해 딥러닝을 강화학습에 적용하는 방법에 대해서 설명하고 있습니다. 아래 내용은 공부하면서 핵심 내용을 정리한 것입니다.

참고자료

7.1 함수를 활용한 근사

◈ 함수의 등장

◈ 함수의 복잡도에 따른 차이

$$f(x)=a_0 + a_1x + a_2x^2 + ... + a_nx^n$$

◈ 오버 피팅과 언더 피팅

$$F(x)=cos(1.5 \pi * x) + x$$

$$F_{real}(x) = F(x) + \varepsilon =cos(1.5 \pi * x) + x + \varepsilon, \; \; \; \; \varepsilon \sim N(0, 1) * {1 \over 10}$$

◈ 함수의 장점 - 일반화

7.2 인공 신경망의 도입

◈ 신경망

◈ 신경망 학습 - 그라디언트 디센트

$$\nabla_wL(s)=\left ( {\partial L(w) \over \partial w_1}, {\partial L(w) \over \partial w_2}, ..., {\partial L(w) \over \partial w_{100}} \right )$$

$$\begin{equation}
\begin{split}
w_1'&=w_1 - \alpha {\partial L(w) \over \partial w_1} \\
w_2'&=w_2 - \alpha {\partial L(w) \over \partial w_2} \\
&...\\
w_{100}'&=w_{100} - \alpha {\partial L(w) \over \partial w_{100}}
\end{split}
\end{equation}$$

◈ 간단한 확인

◈ 파이토치를 이용한 신경망의 학습 구현