
다층 신경망 (Multilayer Neural Networks)과 경사 하강법 (Gradient Descent) 설명
요약
다층 신경망의 학습 핵심 원리인 경사 하강법(Gradient Descent)의 수학적 메커니즘을 설명합니다. 기울기의 부호에 따른 가중치 업데이트 규칙을 통해 손실 함수를 최소화하는 과정을 다룹니다.
핵심 포인트
- 기울기 부호에 따른 가중치 업데이트 방향 결정
- 업데이트 규칙에서 마이너스 부호의 수학적 역할
- 경사 하강법과 역전파(Backpropagation)의 연결 고리
- 연쇄 법칙(Chain Rule) 이해를 위한 기초 개념 제공
제
- 만약 기울기(slope)가 **음수 (negative)**라면 (곡선이 오른쪽으로 갈수록 아래로 향한다면), 가중치(weight)는 최솟값에 더 가까워지기 위해 위로 (up) 이동해야 합니다.
- 만약 기울기(slope)가 **양수 (positive)**라면 (곡선이 오른쪽으로 갈수록 위로 향한다면), 가중치는 아래로 (down) 이동해야 합니다.
이것이 바로 업데이트 규칙(update rule)에 마이너스 부호가 포함되어 있는 정확한 이유입니다 — w_new = w_old - lr * gradient — 양수의 기울기를 빼면 가중치가 내려가고, 음수의 기울기를 빼면 가중치가 올라갑니다. 기울기의 부호가 조향(steering) 역할을 수행하며, 마이너스 부호는 이 조향이 더 높은 손실(loss)이 아닌 더 낮은 손실을 향하도록 만듭니다.
이것이 중요한 이유
단일 뉴런의 수학(이 시리즈의 앞부분에서 다룸)은 손으로 계산할 수 있을 만큼 충분히 간단합니다. 하지만 여러 개의 은닉층 (hidden layers)을 가진 실제 네트워크는 그렇지 않습니다. 그리고 바로 그 점 때문에 역전파 (backpropagation)가 작동하기 위해서는 연쇄 법칙 (chain rule)이 필요한데, 이것이 다음 포스트의 주제입니다. 경사 하강법 (gradient descent)을 국소 기울기 (local slope)에 따라 곡선을 타고 내려가는 공처럼 시각적으로 먼저 이해하면, 뒤따라오는 연쇄 법칙 (chain-rule) 수학이 임의적인 공식이 아닌 자연스러운 확장처럼 느껴질 것입니다.
원본 노트 (The Original Notes):
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기