본문 바로가기
ML

[ML] Ch14. Reinforcement Learning

by 녕인뉸 2022. 6. 19.

1. Reinforcement Learning의 특징 ; data + reward

(1) no supervisor (label x), 오직 reward signal만 있음

(2) 피드백이 지연됨, 동시에 발생하지 않음

(3) 시간이 정말 중요 (sequential, non i.i.d. data)

(4) Agent의 액션은 agent가 수신하는 다음 데이터에 영향을 줌 (현재 선택이 다음에 영향을 줌)

 

 

2. Rewards

(1) reward Rt는 스칼라 피드백 시그널

(2) t 단계에서 agent가 얼마나 잘 움직이는지 나타냄

(3) agent의 일은 누적된 reward를 최대화

(4) Reinforcement Learning은 reward hypothesis을 기반으로 함

 - reward hypothesis : 모든 목표는 예상된 누적 reward의 최대화로 설명할 수 있음

 

 

3. Sequential Decision Making

(1) 목표 : 총 future reward를 최대화 하는 action을 선택

(2) action은 장기적인 결과를 초래하고 state 변화시킴

(3) Reward는 지연될 수 있음

(4) 더 장기적인 reward를 얻기 위해 즉각적인 reward를 희생하는 것이 나을 수 잇음

total reward : optimal

current reward : greedy

 

 

4. Agent and Environment

(1) agent는 observation과 reward를 통해 action을 취함

(2) 각 단계 t에서, agent는 action At를 실행하고 observation Ot를 받고 스칼라 reward Rt를 받음

 environment - action At를 받음, observation Ot+1을 방출, 스칼라 reward Rt+1를 방출

t는 environment 단계에서 증가

 

(3) 각 단계 t에서, agent는 action At를 실행하고 reward Rt+1을 받고 state(observation) St+1로 이동

s1,a1,R2,s2,a2,R3,s3,a3,...

 

 

5. RL의 agent의 주요 요소

(1) policy : agent의 행동 함수

(2) value function : 각 state와 action이 얼마나 좋은지

(3) Model : environ의 agent의 표현

 

 

'ML' 카테고리의 다른 글

콘텐츠 기반 필터링 (Contents-Based Filtering)  (2) 2023.04.11
[ML] Ch13. Dimensionality Reduction  (0) 2022.06.19
[ML] Ch12. Clustering  (0) 2022.06.19
[ML] Ch11. Ensemble Learning  (0) 2022.06.18
[ML] Ch10. Deep Neural Networks 2  (0) 2022.06.18