학습목표
- 통합 분석과 시험 연결의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
분석 파이프라인 · 연구 질문 · 기준선 baseline · 재현성 · 일반화 · 오류 분석
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
좋은 분석은 알고리즘보다 질문에서 시작한다. 집단 차이 추론·미래 예측·구조 탐색 중 무엇인지 정하고 관측 단위·목표·오류 비용을 설계한다. 통계검정은 모집단 차이 증거를, 머신러닝 평가는 보지 않은 자료 예측을 다루므로 한 결과를 다른 목적의 증거로 바꾸지 않는다.
상세 이론
질문을 분석 과제로 번역하기
업무 질문을 설명·추론·예측·탐색 중 하나로 번역하고 의사결정 주체, 시점, 행동, 오류 비용을 정의한다. ‘이탈을 이해한다’보다 ‘다음 30일 이탈 고객을 주간 1천 명 이내로 선별한다’가 평가 가능한 질문이다. 목표가 달라지면 데이터 컷오프, 레이블, 지표, 검증 방식도 달라진다.
데이터 계약과 재현성
관측 단위, 모집단, 기간, 포함·제외 기준, 변수 정의, 레이블 생성 시점, 식별 키를 데이터 계약으로 남긴다. 원자료 버전과 변환 코드, 난수 시드, 라이브러리 버전, 실행 순서를 기록해야 결과를 재현할 수 있다. 수동 수정은 변경 로그와 규칙으로 대체한다.
EDA에서 가설과 위험 만들기
EDA는 결측·이상치·분포·관계를 보는 동시에 누수 후보, 하위집단, 시간 변화, 측정 오류에 대한 가설을 만든다. 탐색에서 발견한 패턴은 개발 가설이며 같은 자료의 p값을 확증 증거로 과장하지 않는다. 중요한 발견은 검증 구간·후속 자료에서 다시 확인한다.
추론 경로와 예측 경로
추론 경로는 목표 모수·비교·식별 가정·표준오차·신뢰구간·검정을 중심으로 구성한다. 예측 경로는 예측 시점의 입력 가용성, 누수 없는 파이프라인, 기준선, 교차검증, 테스트 성능을 중심으로 한다. 예측력이 높은 변수가 조작 가능한 원인이라는 뜻은 아니며 유의한 차이가 좋은 예측력을 뜻하지도 않는다.
모형 선택과 오류 분석
단순 기준선에서 시작해 복잡도와 계산 비용을 단계적으로 높인다. 평균 점수 외에 폴드 변동, 하위집단, 확률 보정, 오류의 실제 비용을 본다. 거짓 양성·거짓 음성 사례를 원자료로 되돌아가 분석하면 레이블 오류, 누락 변수, 운영 규칙 문제를 발견할 수 있다.
결론·한계·다음 실험
결론은 관측된 대상과 기간, 가정이 허용하는 범위 안에서 쓴다. 인과성, 외부 일반화, 미래 분포 변화, 측정오차, 미관측 교란을 한계로 명시한다. 다음 조치는 새 자료 수집, 전향 검증, 임계값 실험, A/B 테스트, 모니터링 계획처럼 현재 불확실성을 줄이는 구체적 실험이어야 한다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 질문을 분석 과제로 번역하기 | 업무 질문을 설명·추론·예측·탐색 중 하나로 번역하고 의사결정 주체, 시점, 행동, 오류 비용을 정의한다. | 데이터 계약과 재현성 |
| 데이터 계약과 재현성 | 관측 단위, 모집단, 기간, 포함·제외 기준, 변수 정의, 레이블 생성 시점, 식별 키를 데이터 계약으로 남긴다. | EDA에서 가설과 위험 만들기 |
| EDA에서 가설과 위험 만들기 | EDA는 결측·이상치·분포·관계를 보는 동시에 누수 후보, 하위집단, 시간 변화, 측정 오류에 대한 가설을 만든다. | 추론 경로와 예측 경로 |
| 추론 경로와 예측 경로 | 추론 경로는 목표 모수·비교·식별 가정·표준오차·신뢰구간·검정을 중심으로 구성한다. | 모형 선택과 오류 분석 |
| 모형 선택과 오류 분석 | 단순 기준선에서 시작해 복잡도와 계산 비용을 단계적으로 높인다. | 결론·한계·다음 실험 |
| 결론·한계·다음 실험 | 결론은 관측된 대상과 기간, 가정이 허용하는 범위 안에서 쓴다. | 질문을 분석 과제로 번역하기 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 질문·관측 단위·평가 지표가 연결되는가
- 추론과 예측의 증거를 구분했는가
- 결론의 범위·한계·다음 실험을 기록했는가
개념 흐름
공식과 해석
질문 → 자료 → 가정 → 방법 → 불확실성/일반화 → 의사결정의 연결을 유지한다.
계산 예제
이탈 예측의 정확도 0.87은 양성 비율·재현율·정밀도·비용을 함께 봐야 한다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
from sklearn.dummy import DummyClassifier
from sklearn.metrics import classification_report
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split
X, y = make_classification(
n_samples=400, n_features=8, n_informative=5,
weights=[0.7, 0.3], random_state=20260721
)
X_train, X_valid, y_train, y_valid = train_test_split(
X, y, test_size=0.25, stratify=y, random_state=20260721
)
base = DummyClassifier(strategy='most_frequent')
base.fit(X_train, y_train)
pred = base.predict(X_valid)
print(classification_report(y_valid, pred, zero_division=0))
print('기준선과 후보를 비교한다.')
print('추론 질문과 예측 질문을 분리한다.')
# 재현 가능한 분석 메모를 남긴다.
장 요약
- 질문을 분석 과제로 번역하기: 업무 질문을 설명·추론·예측·탐색 중 하나로 번역하고 의사결정 주체, 시점, 행동, 오류 비용을 정의한다.
- 데이터 계약과 재현성: 관측 단위, 모집단, 기간, 포함·제외 기준, 변수 정의, 레이블 생성 시점, 식별 키를 데이터 계약으로 남긴다.
- EDA에서 가설과 위험 만들기: EDA는 결측·이상치·분포·관계를 보는 동시에 누수 후보, 하위집단, 시간 변화, 측정 오류에 대한 가설을 만든다.
- 추론 경로와 예측 경로: 추론 경로는 목표 모수·비교·식별 가정·표준오차·신뢰구간·검정을 중심으로 구성한다.
- 모형 선택과 오류 분석: 단순 기준선에서 시작해 복잡도와 계산 비용을 단계적으로 높인다.
- 결론·한계·다음 실험: 결론은 관측된 대상과 기간, 가정이 허용하는 범위 안에서 쓴다.