학습목표
- 비지도학습과 차원 축소의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
비지도학습 unsupervised learning · 군집화 clustering · K-평균 · 실루엣 · PCA · 주성분
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
비지도학습은 레이블 없이 구조를 탐색한다. 군집화는 관측치를 묶고 PCA는 변수를 적은 직교 축으로 요약한다. PCA 좌표는 군집 레이블이 아니다. K-평균은 거리 단위에 민감하고, PCA 첫 성분은 가장 큰 분산 방향일 뿐 가장 중요한 원인을 뜻하지 않는다.
상세 이론
비지도학습의 목표
비지도학습은 정답 없이 밀도, 저차원 구조, 그룹, 동시출현 규칙을 탐색한다. 정답이 없으므로 내부 지표가 높다는 사실만으로 유용한 구조가 보장되지 않는다. 안정성, 재현성, 도메인 해석, 후속 의사결정 가치로 결과를 평가한다.
거리와 유사도
유클리드 거리는 연속형 좌표의 직선거리, 맨해튼 거리는 절대차 합, 코사인 유사도는 벡터 방향을 비교한다. 범주·이진·혼합 자료에는 Jaccard나 Gower 같은 대안이 필요하다. 고차원에서는 거리들이 비슷해지는 집중 현상이 생겨 변수 선택·차원 축소가 중요해진다.
K-평균 군집
K-평균은 군집 내 제곱거리합을 줄이도록 중심 할당과 중심 갱신을 반복한다. 구형·비슷한 크기의 군집과 수치형 자료에 적합하며 초기 중심과 이상치에 민감하다. 여러 초기값을 실행하고 엘보우·실루엣·군집 해석을 함께 사용해 K를 결정한다.
계층적·밀도 기반 군집
계층적 군집은 개별 점에서 시작해 합치거나 전체에서 나누며 덴드로그램으로 여러 해상도를 보여 준다. 연결법에 따라 군집 모양이 달라진다. DBSCAN은 밀도가 높은 영역을 연결하고 희박한 점을 잡음으로 두어 비구형 군집을 찾지만 거리 반경과 최소점 설정, 밀도 차이에 민감하다.
PCA의 선형대수
PCA는 중심화된 자료의 공분산행렬 고유벡터 또는 SVD로 서로 직교하는 축을 찾는다. 첫 성분은 투영 분산을 최대화하고 다음 성분은 앞 축과 직교하면서 남은 분산을 최대화한다. 적재량은 원변수와 성분의 관계, 점수는 관측치의 새 좌표다. 스케일 차이가 크면 표준화 여부가 결과를 바꾼다.
연관규칙과 추천 개요
연관규칙의 지지도는 항목집합 빈도, 신뢰도는 A가 있을 때 B의 조건부 비율, 향상도는 독립 기준 대비 동시발생 배율이다. 높은 신뢰도도 B 자체가 흔하면 특별하지 않을 수 있어 향상도를 본다. 협업필터링은 사용자-항목 상호작용의 유사 패턴을 이용하지만 콜드스타트·인기도 편향을 가진다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 비지도학습의 목표 | 비지도학습은 정답 없이 밀도, 저차원 구조, 그룹, 동시출현 규칙을 탐색한다. | 거리와 유사도 |
| 거리와 유사도 | 유클리드 거리는 연속형 좌표의 직선거리, 맨해튼 거리는 절대차 합, 코사인 유사도는 벡터 방향을 비교한다. | K-평균 군집 |
| K-평균 군집 | K-평균은 군집 내 제곱거리합을 줄이도록 중심 할당과 중심 갱신을 반복한다. | 계층적·밀도 기반 군집 |
| 계층적·밀도 기반 군집 | 계층적 군집은 개별 점에서 시작해 합치거나 전체에서 나누며 덴드로그램으로 여러 해상도를 보여 준다. | PCA의 선형대수 |
| PCA의 선형대수 | PCA는 중심화된 자료의 공분산행렬 고유벡터 또는 SVD로 서로 직교하는 축을 찾는다. | 연관규칙과 추천 개요 |
| 연관규칙과 추천 개요 | 연관규칙의 지지도는 항목집합 빈도, 신뢰도는 A가 있을 때 B의 조건부 비율, 향상도는 독립 기준 대비 동시발생 배율이다. | 비지도학습의 목표 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 거리와 스케일이 자료에 적합한가
- 내부 지표 외 안정성과 해석을 확인했는가
- PCA 좌표와 군집 레이블을 구분했는가
개념 흐름

그림. PCA는 축을 줄이고 군집화는 관측치를 묶는다.
공식과 해석
K-평균은 를 줄인다.
계산 예제
(0,0),(2,0)의 한 중심은 (1,0)이고 제곱거리합은 2다. 각각을 따로 두면 0이지만 요약 목적을 잃는다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
from sklearn.preprocessing import StandardScaler
from sklearn.decomposition import PCA
from sklearn.cluster import KMeans
Z = PCA(n_components=2).fit_transform(StandardScaler().fit_transform(X_train))
labels = KMeans(n_clusters=3, n_init=20, random_state=20260713).fit_predict(Z)
print('축소 좌표:', Z.shape)
print('군집 크기:', [(labels==k).sum() for k in range(3)])
print('PCA와 군집의 산출물은 다르다.')
# K는 도메인 해석과 함께 고른다.
장 요약
- 비지도학습의 목표: 비지도학습은 정답 없이 밀도, 저차원 구조, 그룹, 동시출현 규칙을 탐색한다.
- 거리와 유사도: 유클리드 거리는 연속형 좌표의 직선거리, 맨해튼 거리는 절대차 합, 코사인 유사도는 벡터 방향을 비교한다.
- K-평균 군집: K-평균은 군집 내 제곱거리합을 줄이도록 중심 할당과 중심 갱신을 반복한다.
- 계층적·밀도 기반 군집: 계층적 군집은 개별 점에서 시작해 합치거나 전체에서 나누며 덴드로그램으로 여러 해상도를 보여 준다.
- PCA의 선형대수: PCA는 중심화된 자료의 공분산행렬 고유벡터 또는 SVD로 서로 직교하는 축을 찾는다.
- 연관규칙과 추천 개요: 연관규칙의 지지도는 항목집합 빈도, 신뢰도는 A가 있을 때 B의 조건부 비율, 향상도는 독립 기준 대비 동시발생 배율이다.