with-RL
강화 학습2024년 1월 17일

바닥부터 배우는 강화 학습 | 01. 강화 학습이란

강화 학습 공부를 다시 시작합니다. 예전에 관심 있게 봤던 팡요랩의 저가가 쓰신 '바닥부터 배우는 강화 학습'을 첫 번째 공부 교재로 사용하려고 합니다. 아래 내용은 공부하면서 핵심 내용을 정리한 것입니다.

참고자료

1.1 지도 학습과 강화 학습

◈ 기계 학습의 분류

◈ 지도 학습

◈ 강화 학습

1.2 순차적 의사결정 문제

강화 학습이 풀고자 하는 문제는 순차적 의사결정(sequential decision making) 문제

◈ 샤워하는 남자

◈ 순차적 의사결정 문제의 예시

주식 투자에서의 포트폴리오 관리
언제 어떤 주식을 사고 팔지를 결정해야 하는 주식 포트폴리오 관리는 순차적 의사결정 문제로 볼 수 있음

운전
어떤 도로를 이용할지, 어떤 차선을 이용할지, 브레이크 또는 액셀을 밟을지를 결정하는 것도 순차적 의사결정 과정

게임
대부분의 게임이 잘게 쪼개진 선택의 연속으로 이루어져 있으며, 주어지 상황 안에서 최선의 선택을 내려야 함

1.3 보상

보상(reward)이란 얼마나 잘하고 있는지 알려주는 신호.
강화 학습의 목적은 과정에서 받는 보상의 총합, 즉 누적 보상(cululative reward)을 최대화하는 것

어떻게 X 얼마나 O

스칼라

희소하고 지연된 보상

1.4 에이전트와 환경

에이전트가 액션(action)을 하고 그에 따라 상황이 변하는 하나의 루프(loop)라 했을 때 이 루프가 끊임없이 반복되는 것을 순차적 의사결정 문제라 할 수 있음.

1.5 강화 학습의 위력

◈ 병렬성의 힘

수많은 컴퓨터를 병렬로 연결해서 시뮬레이션을 진행하고 시뮬레이션 결과를 모아서 중앙에서 학습하면 빠른 학습 가능

◈ 자가 학습 (self-learning)의 매력

시뮬레이션 환경 속에 던져 놓고 목적만 알려주고 알아서 배우게 하는 강화 학습이 유연하고 자유롭고 성능면에서도 뛰어남

바닥부터 배우는 강화 학습 | 01. 강화 학습이란 | with-RL