Stat & ML
데이터의 언어에서 통계적 추론, 머신러닝 평가와 통합 분석까지 이어지는 18개 장.
Part
I. 데이터와 통계적 사고
4 chapters
- 01데이터·변수·표본의 언어데이터의 행은 관측 단위, 열은 변수다. 분석 전에 관측 단위·기간·식별자를 정해야 중복과 시간 단위 혼동을 막는다. 명목·순서·등간·비율척도는 허용하는 비교가 다르며, 숫자로 저장된 만족도도 순서형일 수 있다. 기술통계는 표본을 요약하고 추론통계는 표본오차와 가정 아래 모집단에 관해 말한다.8 min
- 02일변량 기술통계일변량 탐색은 전형적인 값뿐 아니라 흩어짐·꼬리·봉우리·빈 구간을 묻는다. 평균은 극단값에 민감하고 중앙값은 치우친 분포에서 더 안정적일 수 있다. 표준화는 단위가 다른 변수의 상대 위치를 비교하는 변환이며 큰 z점수는 오류가 아니라 검토 후보를 뜻한다.7 min
- 03EDA와 변수 관계EDA는 모델 전에 자료 패턴과 품질 문제를 탐색한다. 수치-수치는 산점도, 범주-범주는 교차표, 범주-수치는 그룹별 분포가 출발점이다. 상관계수는 선형 관계 요약일 뿐 비선형 관계·인과관계의 증거가 아니므로 시간 순서·공통 원인을 점검한다.8 min
- 04분석용 데이터 준비전처리는 빈칸을 기계적으로 채우는 일이 아니라 결측 이유·오류·관측 불가능을 구분하는 일이다. 거리 기반 모델은 단위가 큰 변수를 더 중요하게 보므로 스케일링이 중요하다. 대치·스케일링·범주 목록·변수 선택은 학습 자료에서만 적합한 뒤 평가 자료에 적용해야 한다.8 min
Part
II. 확률과 통계적 추론
5 chapters
- 05확률의 기초표본공간은 가능한 결과의 집합, 사건은 그 일부다. 독립은 P(A∩B)=P(A)P(B)가 성립하는 엄격한 관계다. 베이즈 정리는 검사 결과에서 실제 상태 확률로 방향을 바꾸며 민감도뿐 아니라 기저율을 반영한다.7 min
- 06확률분포와 요약량확률분포는 가능한 값과 불확실성을 기술한다. 이산형은 특정 값 확률을 더하고 연속형은 구간 아래 면적으로 해석한다. 이항은 독립 성공 횟수, 포아송은 구간 사건 수, 정규는 대칭 연속 변동의 대표 모형이며 이름보다 조건을 확인한다.7 min
- 07표본분포와 추정반복 표본추출로 얻은 평균들의 분포가 표본분포다. 표준오차는 추정량의 표본 간 흔들림으로 원자료 표준편차와 다르다. 95% 신뢰구간은 같은 절차를 반복할 때 만들어진 구간의 약 95%가 고정된 모수를 포함한다는 성질이다.7 min
- 08가설검정의 원리가설검정은 H0 아래 관측 결과가 얼마나 이례적인지 평가한다. p값은 H0가 참일 때 관측값 이상으로 극단적인 결과의 확률이지 H0가 참일 확률이 아니다. p가 크면 H0를 채택하는 것이 아니라 현재 설계에서 기각할 충분한 증거가 없다고 말한다.7 min
- 09검정 선택과 해석검정 선택은 이름보다 질문 구조에서 시작한다. 두 독립 평균에는 독립 t, 같은 사람 전후에는 대응 t, 세 집단 이상에는 ANOVA, 범주형 관련성에는 카이제곱을 고려한다. 정규성·등분산성·독립성은 결과 뒤에 붙이는 장식이 아니다.8 min
Part
III. 예측 모델링
4 chapters
- 10회귀분석 기초선형회귀는 입력 가중합으로 연속형 결과를 설명·예측한다. 다중회귀 계수는 다른 변수를 고정한다는 조건 아래의 변화다. 잔차 곡선·깔때기·영향점은 가정 문제를 시사하며 R²가 높아도 외삽·인과 설명은 보장되지 않는다.8 min
- 11모델링 실험 설계와 평가모델 선택은 보지 않은 자료 일반화 성능을 추정하는 실험이다. 교차검증의 각 폴드 학습 부분에서만 대치·스케일링·변수 선택·리샘플링을 적합한다. 테스트셋은 선택이 끝난 뒤 한 번만 최종 보고에 사용하며, 불균형 자료에서는 정확도 대신 오류 비용에 맞는 지표를 본다.8 min
- 12지도학습: 선형 분류와 거리 기반 방법지도학습은 입력과 레이블 쌍으로 새 입력을 예측한다. 로지스틱 회귀는 선형 점수를 확률처럼 변환하고, K-NN은 거리와 스케일에 민감하며, SVM은 여백이 큰 경계를 찾는다. 분류 임계값 0.5는 자연법칙이 아니라 오류 비용에 따른 의사결정 값이다.8 min
- 13트리와 앙상블나무는 규칙을 반복 적용해 더 균질한 부분으로 나눈다. 깊은 나무는 학습 자료를 외워 일반화가 나빠질 수 있다. 배깅은 분산을 줄이고, 랜덤포레스트는 변수 무작위화도 쓰며, 부스팅은 앞 모델 오류에 순차 집중한다.8 min
Part
IV. 표현과 고급 자료
3 chapters
- 14비지도학습과 차원 축소비지도학습은 레이블 없이 구조를 탐색한다. 군집화는 관측치를 묶고 PCA는 변수를 적은 직교 축으로 요약한다. PCA 좌표는 군집 레이블이 아니다. K-평균은 거리 단위에 민감하고, PCA 첫 성분은 가장 큰 분산 방향일 뿐 가장 중요한 원인을 뜻하지 않는다.8 min
- 15신경망과 딥러닝 기초신경망 층은 가중합·편향 뒤 비선형 활성화를 적용한다. 비선형성이 없으면 여러 층도 하나의 선형변환과 같다. 역전파는 손실의 가중치별 민감도를 계산하고 경사하강은 반대 방향으로 갱신한다. CNN은 공간 구조, RNN 계열은 순서 구조가 중요한 자료에 적합할 수 있다.8 min
- 16고급 데이터: 시계열·텍스트·시공간시계열은 순서가 정보다. 추세는 장기 변화, 계절성은 주기 반복, 자기상관은 과거와 현재 관계다. 무작위 분할은 미래 정보를 학습으로 섞을 수 있다. 텍스트는 수치화하면서 문맥 손실이 생기고, 시공간 자료는 이웃 의존성 때문에 임의 행 분할을 경계한다.7 min
Part
V. 개선과 통합
2 chapters
- 17모형 개선·결과 해석·시각화너무 단순하면 신호를 놓치고 너무 유연하면 잡음까지 따라간다. 정규화는 큰 계수에 벌점을 주어 복잡도를 제어하며 초매개변수는 교차검증으로 선택한다. 테스트셋은 마지막 독립 평가에 한 번만 쓰고, 결과를 보고 재튜닝하면 새 테스트셋이 필요하다.8 min
- 18통합 분석 워크플로좋은 분석은 알고리즘보다 질문에서 시작한다. 집단 차이 추론·미래 예측·구조 탐색 중 무엇인지 정하고 관측 단위·목표·오류 비용을 설계한다. 통계검정은 모집단 차이 증거를, 머신러닝 평가는 보지 않은 자료 예측을 다루므로 한 결과를 다른 목적의 증거로 바꾸지 않는다.8 min