블로그
- [수학] 확률의 연쇄법칙(chain rule) 강화학습의 상태가치함수와 행동가치함수 유도하는 과정에서 여러번 쓰인다.
- 델타학습법 : "얼마나 틀렸는지(오차)를 계산하고, 그 오차를 가장 빨리 줄이는 방향으로 조금씩 수정한다." 평균제곱오차(MSE)를 줄이는 원리 이해 오류 역전파(Backpropagation) 델타 학습법을 다층 신경망으로 확장한 알고리즘 출력층뿐 아니라 은닉층까지 오차를 전달 연쇄법칙(Chain Rule) 을 이용하여 각 가중치의.......
- Chain Rule 함수 의 미분 가능성은 특정한 linear map의 존재성에 의하여 정의된다. 즉, 인 경우에 f는 a∈X에서 미분 가능하다고 정의된다(sup norm이 아닌 Euclidean norm을 사용해도 상관없다). 그러한 linear map J는 일반적으로 "Df(a)"로 지칭된다. 모든 l