Stat & ML

데이터의 언어에서 통계적 추론, 머신러닝 평가와 통합 분석까지 이어지는 18개 장.

용어집

Part

I. 데이터와 통계적 사고

4 chapters

  1. 01데이터·변수·표본의 언어데이터의 행은 관측 단위, 열은 변수다. 분석 전에 관측 단위·기간·식별자를 정해야 중복과 시간 단위 혼동을 막는다. 명목·순서·등간·비율척도는 허용하는 비교가 다르며, 숫자로 저장된 만족도도 순서형일 수 있다. 기술통계는 표본을 요약하고 추론통계는 표본오차와 가정 아래 모집단에 관해 말한다.8 min
  2. 02일변량 기술통계일변량 탐색은 전형적인 값뿐 아니라 흩어짐·꼬리·봉우리·빈 구간을 묻는다. 평균은 극단값에 민감하고 중앙값은 치우친 분포에서 더 안정적일 수 있다. 표준화는 단위가 다른 변수의 상대 위치를 비교하는 변환이며 큰 z점수는 오류가 아니라 검토 후보를 뜻한다.7 min
  3. 03EDA와 변수 관계EDA는 모델 전에 자료 패턴과 품질 문제를 탐색한다. 수치-수치는 산점도, 범주-범주는 교차표, 범주-수치는 그룹별 분포가 출발점이다. 상관계수는 선형 관계 요약일 뿐 비선형 관계·인과관계의 증거가 아니므로 시간 순서·공통 원인을 점검한다.8 min
  4. 04분석용 데이터 준비전처리는 빈칸을 기계적으로 채우는 일이 아니라 결측 이유·오류·관측 불가능을 구분하는 일이다. 거리 기반 모델은 단위가 큰 변수를 더 중요하게 보므로 스케일링이 중요하다. 대치·스케일링·범주 목록·변수 선택은 학습 자료에서만 적합한 뒤 평가 자료에 적용해야 한다.8 min

Part

II. 확률과 통계적 추론

5 chapters

  1. 05확률의 기초표본공간은 가능한 결과의 집합, 사건은 그 일부다. 독립은 P(A∩B)=P(A)P(B)가 성립하는 엄격한 관계다. 베이즈 정리는 검사 결과에서 실제 상태 확률로 방향을 바꾸며 민감도뿐 아니라 기저율을 반영한다.7 min
  2. 06확률분포와 요약량확률분포는 가능한 값과 불확실성을 기술한다. 이산형은 특정 값 확률을 더하고 연속형은 구간 아래 면적으로 해석한다. 이항은 독립 성공 횟수, 포아송은 구간 사건 수, 정규는 대칭 연속 변동의 대표 모형이며 이름보다 조건을 확인한다.7 min
  3. 07표본분포와 추정반복 표본추출로 얻은 평균들의 분포가 표본분포다. 표준오차는 추정량의 표본 간 흔들림으로 원자료 표준편차와 다르다. 95% 신뢰구간은 같은 절차를 반복할 때 만들어진 구간의 약 95%가 고정된 모수를 포함한다는 성질이다.7 min
  4. 08가설검정의 원리가설검정은 H0 아래 관측 결과가 얼마나 이례적인지 평가한다. p값은 H0가 참일 때 관측값 이상으로 극단적인 결과의 확률이지 H0가 참일 확률이 아니다. p가 크면 H0를 채택하는 것이 아니라 현재 설계에서 기각할 충분한 증거가 없다고 말한다.7 min
  5. 09검정 선택과 해석검정 선택은 이름보다 질문 구조에서 시작한다. 두 독립 평균에는 독립 t, 같은 사람 전후에는 대응 t, 세 집단 이상에는 ANOVA, 범주형 관련성에는 카이제곱을 고려한다. 정규성·등분산성·독립성은 결과 뒤에 붙이는 장식이 아니다.8 min

Part

III. 예측 모델링

4 chapters

  1. 10회귀분석 기초선형회귀는 입력 가중합으로 연속형 결과를 설명·예측한다. 다중회귀 계수는 다른 변수를 고정한다는 조건 아래의 변화다. 잔차 곡선·깔때기·영향점은 가정 문제를 시사하며 R²가 높아도 외삽·인과 설명은 보장되지 않는다.8 min
  2. 11모델링 실험 설계와 평가모델 선택은 보지 않은 자료 일반화 성능을 추정하는 실험이다. 교차검증의 각 폴드 학습 부분에서만 대치·스케일링·변수 선택·리샘플링을 적합한다. 테스트셋은 선택이 끝난 뒤 한 번만 최종 보고에 사용하며, 불균형 자료에서는 정확도 대신 오류 비용에 맞는 지표를 본다.8 min
  3. 12지도학습: 선형 분류와 거리 기반 방법지도학습은 입력과 레이블 쌍으로 새 입력을 예측한다. 로지스틱 회귀는 선형 점수를 확률처럼 변환하고, K-NN은 거리와 스케일에 민감하며, SVM은 여백이 큰 경계를 찾는다. 분류 임계값 0.5는 자연법칙이 아니라 오류 비용에 따른 의사결정 값이다.8 min
  4. 13트리와 앙상블나무는 규칙을 반복 적용해 더 균질한 부분으로 나눈다. 깊은 나무는 학습 자료를 외워 일반화가 나빠질 수 있다. 배깅은 분산을 줄이고, 랜덤포레스트는 변수 무작위화도 쓰며, 부스팅은 앞 모델 오류에 순차 집중한다.8 min

Part

IV. 표현과 고급 자료

3 chapters

  1. 14비지도학습과 차원 축소비지도학습은 레이블 없이 구조를 탐색한다. 군집화는 관측치를 묶고 PCA는 변수를 적은 직교 축으로 요약한다. PCA 좌표는 군집 레이블이 아니다. K-평균은 거리 단위에 민감하고, PCA 첫 성분은 가장 큰 분산 방향일 뿐 가장 중요한 원인을 뜻하지 않는다.8 min
  2. 15신경망과 딥러닝 기초신경망 층은 가중합·편향 뒤 비선형 활성화를 적용한다. 비선형성이 없으면 여러 층도 하나의 선형변환과 같다. 역전파는 손실의 가중치별 민감도를 계산하고 경사하강은 반대 방향으로 갱신한다. CNN은 공간 구조, RNN 계열은 순서 구조가 중요한 자료에 적합할 수 있다.8 min
  3. 16고급 데이터: 시계열·텍스트·시공간시계열은 순서가 정보다. 추세는 장기 변화, 계절성은 주기 반복, 자기상관은 과거와 현재 관계다. 무작위 분할은 미래 정보를 학습으로 섞을 수 있다. 텍스트는 수치화하면서 문맥 손실이 생기고, 시공간 자료는 이웃 의존성 때문에 임의 행 분할을 경계한다.7 min

Part

V. 개선과 통합

2 chapters

  1. 17모형 개선·결과 해석·시각화너무 단순하면 신호를 놓치고 너무 유연하면 잡음까지 따라간다. 정규화는 큰 계수에 벌점을 주어 복잡도를 제어하며 초매개변수는 교차검증으로 선택한다. 테스트셋은 마지막 독립 평가에 한 번만 쓰고, 결과를 보고 재튜닝하면 새 테스트셋이 필요하다.8 min
  2. 18통합 분석 워크플로좋은 분석은 알고리즘보다 질문에서 시작한다. 집단 차이 추론·미래 예측·구조 탐색 중 무엇인지 정하고 관측 단위·목표·오류 비용을 설계한다. 통계검정은 모집단 차이 증거를, 머신러닝 평가는 보지 않은 자료 예측을 다루므로 한 결과를 다른 목적의 증거로 바꾸지 않는다.8 min