Stat & ML

IV. 표현과 고급 자료 / M15

신경망과 딥러닝 기초

8 minv1.0.0검토 2026-07-21
이 문서의 목차

학습목표

  • 신경망과 딥러닝 기초의 대상·가정·산출물을 설명한다.
  • 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
  • Python으로 재현 가능한 점검의 출발점을 만든다.

핵심 용어

퍼셉트론 · 활성화함수 · 손실함수 · 역전파 · 경사하강법 · CNN · RNN
한·영 정의와 약어는 통합 용어집을 함께 참조한다.

개념 설명

신경망 층은 가중합·편향 뒤 비선형 활성화를 적용한다. 비선형성이 없으면 여러 층도 하나의 선형변환과 같다. 역전파는 손실의 가중치별 민감도를 계산하고 경사하강은 반대 방향으로 갱신한다. CNN은 공간 구조, RNN 계열은 순서 구조가 중요한 자료에 적합할 수 있다.

상세 이론

퍼셉트론과 다층망

퍼셉트론은 입력 가중합에 임계함수를 적용하는 선형 분류기다. XOR처럼 선형 분리되지 않는 관계는 단일 퍼셉트론으로 표현할 수 없다. 은닉층과 비선형 활성화를 쌓은 다층 퍼셉트론은 조각별 선형 변환을 합성해 복잡한 함수를 근사한다.

활성화함수

시그모이드는 0과 1, tanh는 -1과 1 범위지만 큰 절댓값에서 기울기가 작아져 깊은 망의 기울기 소실을 유발할 수 있다. ReLU는 양수 영역 기울기를 유지해 널리 쓰이지만 음수 영역 뉴런이 영구히 꺼질 수 있다. 출력층 활성화는 이진 분류 시 sigmoid, 다중 분류 시 softmax, 회귀 시 선형처럼 목표와 손실에 맞춘다.

손실함수와 최적화

회귀의 MSE, 이진 분류의 교차엔트로피는 예측 오류를 미분 가능한 스칼라로 만든다. 경사하강은 미니배치의 기울기로 파라미터를 갱신하며 학습률이 너무 크면 발산하고 너무 작으면 느리다. Momentum·Adam은 기울기 누적과 좌표별 학습률을 조절하지만 검증 기반 설정이 필요하다.

역전파

역전파는 계산 그래프의 연쇄법칙을 출력에서 입력 방향으로 효율적으로 적용한다. 순전파에서 중간 활성화를 저장하고, 손실의 각 노드별 편미분을 뒤로 전달해 가중치 기울기를 계산한다. 역전파는 기울기 계산 알고리즘이며 실제 갱신 규칙은 옵티마이저가 담당한다.

과적합 제어

신경망은 파라미터가 많아 작은 자료를 쉽게 외운다. 가중치 감쇠, dropout, 데이터 증강, 조기 종료, 배치 정규화와 충분한 검증을 사용한다. 학습·검증 곡선의 간격, 하위집단 오류, 여러 시드의 변동을 보고 우연한 초기화 성능을 경계한다.

CNN·RNN과 적용 조건

CNN은 국소 수용영역과 가중치 공유로 이미지·격자 자료의 이동 패턴을 효율적으로 학습한다. RNN은 이전 상태로 순서 정보를 전달하지만 긴 의존성에서 기울기 문제가 있어 LSTM·GRU가 사용된다. 현재는 attention 기반 모델도 널리 쓰이지만 시험에서는 각 구조가 활용하는 공간·순서 귀납편향을 구분하는 것이 핵심이다.

개념 비교표

개념핵심 역할함께 구분할 개념
퍼셉트론과 다층망퍼셉트론은 입력 가중합에 임계함수를 적용하는 선형 분류기다.활성화함수
활성화함수시그모이드는 0과 1, tanh는 -1과 1 범위지만 큰 절댓값에서 기울기가 작아져 깊은 망의 기울기 소실을 유발할 수 있다.손실함수와 최적화
손실함수와 최적화회귀의 MSE, 이진 분류의 교차엔트로피는 예측 오류를 미분 가능한 스칼라로 만든다.역전파
역전파역전파는 계산 그래프의 연쇄법칙을 출력에서 입력 방향으로 효율적으로 적용한다.과적합 제어
과적합 제어신경망은 파라미터가 많아 작은 자료를 쉽게 외운다.CNN·RNN과 적용 조건
CNN·RNN과 적용 조건CNN은 국소 수용영역과 가중치 공유로 이미지·격자 자료의 이동 패턴을 효율적으로 학습한다.퍼셉트론과 다층망

적용 조건과 진단

다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.

  • 단순 기준선과 비교했는가
  • 학습·검증 곡선과 여러 시드를 보았는가
  • 출력 활성화와 손실이 목표에 맞는가

개념 흐름

활성화함수는 가중합에 비선형성을 더한다.

그림. 활성화함수는 가중합에 비선형성을 더한다.

공식과 해석

a=g(wx+b)a=g(wx+b), wwηL/ww\leftarrow w-\eta\partial L/\partial w다.

계산 예제

L=(yy^)2L=(y-\hat y)^2, y=1, yhat=0.6이면 L=0.16이다.

Python 예제

실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.

from sklearn.neural_network import MLPClassifier
from sklearn.preprocessing import StandardScaler
from sklearn.pipeline import make_pipeline

from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split

X, y = make_classification(
    n_samples=400, n_features=8, n_informative=5,
    weights=[0.7, 0.3], random_state=20260721
)
X_train, X_valid, y_train, y_valid = train_test_split(
    X, y, test_size=0.25, stratify=y, random_state=20260721
)

net = make_pipeline(StandardScaler(), MLPClassifier(hidden_layer_sizes=(32,16), max_iter=300, random_state=20260713))
net.fit(X_train, y_train)
print('학습:', net.score(X_train,y_train))
print('검증:', net.score(X_valid,y_valid))
print('반복:', net.named_steps['mlpclassifier'].n_iter_)
# 학습·검증 차이로 과적합을 점검한다.

장 요약

  • 퍼셉트론과 다층망: 퍼셉트론은 입력 가중합에 임계함수를 적용하는 선형 분류기다.
  • 활성화함수: 시그모이드는 0과 1, tanh는 -1과 1 범위지만 큰 절댓값에서 기울기가 작아져 깊은 망의 기울기 소실을 유발할 수 있다.
  • 손실함수와 최적화: 회귀의 MSE, 이진 분류의 교차엔트로피는 예측 오류를 미분 가능한 스칼라로 만든다.
  • 역전파: 역전파는 계산 그래프의 연쇄법칙을 출력에서 입력 방향으로 효율적으로 적용한다.
  • 과적합 제어: 신경망은 파라미터가 많아 작은 자료를 쉽게 외운다.
  • CNN·RNN과 적용 조건: CNN은 국소 수용영역과 가중치 공유로 이미지·격자 자료의 이동 패턴을 효율적으로 학습한다.

더 읽을거리