블로그
- 마르코프 성질 어떤 확률과정(stochastic process)이 과거로부터 현재에 이르는 정보에 대한 미래의 조건부 기댓값이 과거에 의존하지 않고 오로지 현재에만 의존할 때 마르코프 과정이라고
- 강화 학습[Reinforcement Learning(RL)]의 주요 개념 및 용어 요약 정리 - 초보자를 위한 수학식 없는 설명 □ 마르코프 결정 과정[Markov Decision Process(MDP)] 1. 마르코프 체인[Markov Chain]에 기반한 의사 결정 MDP는 이산 시간[Discrete Time]에서 확률에 기반하여[Stochastic] 순차적 상태 전이를 표현한 마르코프