학습목표
- 분석용 데이터 준비의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
결측 missing value · 이상치 outlier · 스케일링 scaling · 인코딩 encoding · 파생변수 feature engineering · 누수 data leakage
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
전처리는 빈칸을 기계적으로 채우는 일이 아니라 결측 이유·오류·관측 불가능을 구분하는 일이다. 거리 기반 모델은 단위가 큰 변수를 더 중요하게 보므로 스케일링이 중요하다. 대치·스케일링·범주 목록·변수 선택은 학습 자료에서만 적합한 뒤 평가 자료에 적용해야 한다.
상세 이론
데이터 품질의 차원
분석용 품질은 정확성, 완전성, 일관성, 유일성, 적시성, 유효성으로 나눠 점검할 수 있다. 범위 오류와 형식 오류는 규칙으로 찾기 쉽지만 실제처럼 보이는 잘못된 값은 도메인 지식이 필요하다. 원자료를 덮어쓰지 않고 변환 규칙·변경 수·영향 변수를 기록해야 재현성과 감사 가능성을 확보한다.
결측 메커니즘
결측은 다른 변수와 무관한 MCAR, 관측된 변수로 설명되는 MAR, 결측값 자체 또는 미관측 요인과 연결된 MNAR로 개념적으로 구분한다. 단순 평균 대치는 분산과 변수 관계를 약화시키며 표준오차를 과소평가할 수 있다. 삭제·단순 대치·다중대치·모형 기반 처리의 타당성은 결측 원인과 분석 목적에 달려 있다.
이상치와 영향점
이상치는 분포상 드문 관측이고 영향점은 모형 계수나 예측을 크게 바꾸는 관측이다. 드물다고 영향력이 큰 것은 아니며, 입력 공간에서 멀거나 잔차가 큰 관측의 결합이 중요하다. 박스플롯, z점수, 로버스트 거리, 회귀의 레버리지·Cook 거리 등을 사용하되 오류·희귀 정상·목표 사건을 구분한 뒤 처리한다.
변환과 스케일링
로그·제곱근·Box-Cox·Yeo-Johnson 변환은 비대칭과 분산-평균 관계를 완화할 수 있다. 표준화는 평균 0·표준편차 1, min-max는 특정 범위, 로버스트 스케일링은 중앙값·IQR을 사용한다. 거리·정규화 모델은 스케일에 민감하지만 트리는 단조 변환에 상대적으로 둔감하다. 변환 파라미터는 학습 자료에서만 추정한다.
범주형 인코딩과 파생변수
순서 없는 범주에는 원-핫 인코딩이 기본이며 순서형에는 순서 정보를 반영할 수 있다. 목표 인코딩은 목표 평균을 사용하므로 폴드 밖 정보가 새지 않도록 교차적 방식이 필요하다. 파생변수는 비율·차이·로그·시간 경과·집계 등 도메인 구조를 표현하지만, 예측 시점 이후 정보로 만들면 누수다.
불균형 처리와 파이프라인
소수 클래스가 중요한 문제에서 정확도는 무의미할 수 있다. 클래스 가중치, 임계값 조정, 언더·오버샘플링, 합성 샘플링을 고려하며 리샘플링도 각 학습 폴드 안에서만 수행한다. 파이프라인은 전처리와 모형을 하나의 추정 단위로 묶어 같은 변환을 검증·테스트·배포에 적용하고 누수를 막는다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 데이터 품질의 차원 | 분석용 품질은 정확성, 완전성, 일관성, 유일성, 적시성, 유효성으로 나눠 점검할 수 있다. | 결측 메커니즘 |
| 결측 메커니즘 | 결측은 다른 변수와 무관한 MCAR, 관측된 변수로 설명되는 MAR, 결측값 자체 또는 미관측 요인과 연결된 MNAR로 개념적으로 구분한다. | 이상치와 영향점 |
| 이상치와 영향점 | 이상치는 분포상 드문 관측이고 영향점은 모형 계수나 예측을 크게 바꾸는 관측이다. | 변환과 스케일링 |
| 변환과 스케일링 | 로그·제곱근·Box-Cox·Yeo-Johnson 변환은 비대칭과 분산-평균 관계를 완화할 수 있다. | 범주형 인코딩과 파생변수 |
| 범주형 인코딩과 파생변수 | 순서 없는 범주에는 원-핫 인코딩이 기본이며 순서형에는 순서 정보를 반영할 수 있다. | 불균형 처리와 파이프라인 |
| 불균형 처리와 파이프라인 | 소수 클래스가 중요한 문제에서 정확도는 무의미할 수 있다. | 데이터 품질의 차원 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 전처리 fit이 학습 폴드 안에서 이루어졌는가
- 예측 시점 이후 정보가 없는가
- 원자료와 변경 로그를 보존했는가
개념 흐름

그림. 전처리는 원자료의 문제를 숨기기보다 기록 가능한 변환으로 다룬다.
공식과 해석
이며 학습 자료 통계만 쓴다.
계산 예제
학습값 10,20,30으로 만든 평균 20·표준편차 10을 테스트 40에 적용하면 2다. 테스트를 포함하면 누수다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
from sklearn.impute import SimpleImputer
from sklearn.preprocessing import StandardScaler
from sklearn.pipeline import make_pipeline
prep = make_pipeline(SimpleImputer(strategy='median'), StandardScaler())
X_train_ready = prep.fit_transform(X_train)
X_test_ready = prep.transform(X_test)
print(X_train_ready.shape)
print(X_test_ready.shape)
print('학습 자료에서만 fit')
장 요약
- 데이터 품질의 차원: 분석용 품질은 정확성, 완전성, 일관성, 유일성, 적시성, 유효성으로 나눠 점검할 수 있다.
- 결측 메커니즘: 결측은 다른 변수와 무관한 MCAR, 관측된 변수로 설명되는 MAR, 결측값 자체 또는 미관측 요인과 연결된 MNAR로 개념적으로 구분한다.
- 이상치와 영향점: 이상치는 분포상 드문 관측이고 영향점은 모형 계수나 예측을 크게 바꾸는 관측이다.
- 변환과 스케일링: 로그·제곱근·Box-Cox·Yeo-Johnson 변환은 비대칭과 분산-평균 관계를 완화할 수 있다.
- 범주형 인코딩과 파생변수: 순서 없는 범주에는 원-핫 인코딩이 기본이며 순서형에는 순서 정보를 반영할 수 있다.
- 불균형 처리와 파이프라인: 소수 클래스가 중요한 문제에서 정확도는 무의미할 수 있다.