블로그
- 일타기초과학 #23 비마르코프 기반 감염재생산지수 추정법 이 가정은 마르코프 과정(Markov process)에 해당하며, 현재 상태만으로 미래 감염 확률을 계산하고 과거의 감염 시점은 고려하지 않습니다.
- 강화 학습[Reinforcement Learning(RL)]의 주요 개념 및 용어 요약 정리 - 초보자를 위한 수학식 없는 설명 □ 마르코프 결정 과정[Markov Decision Process(MDP)] 1. 체인[Markov Chain]에 의사 결정 문제를 포함시켜 수학적으로 모델링한 프레임워크입니다. 2.
- [강화학습] Markov Decision Process (MDP) Markov Decision Process (MDP) : 어떤 상황에서 어떤 행동을 선택해야 할지 알려주는모델 MDP 구성 요소 상태 : 지금 상황 Ex.
- 강화학습 상태(state) 행동(action) 보상(reward) 탐험과 탐사 갈등(Exploration and exploitation conflict) 마르코프 결정 프로세스(MDP) Markov (state-action value function) 할인 누적 보상액(discounted accumulating reward) MDP(Markov Decision Process)