Stat & ML

부록 / M00

통계·머신러닝 용어집

13 minv1.0.0검토 2026-07-21
이 문서의 목차

이 용어집은 단어 번역뿐 아니라 정의, 인접 개념과의 경계, 해석상 주의점을 함께 제공한다. 장 본문의 첫 등장에서는 한국어와 영어를 병기하고, 여기서는 복습과 교차 참조에 사용한다.

데이터와 기술통계

한국어English / 약어정의구분·주의
관측 단위observation unit데이터 한 행이 대표하는 대상. 고객과 고객-월은 서로 다른 단위다.분석 질문과 단위가 다르면 의사반복과 잘못된 표본 수가 생긴다.
변수variable관측 단위마다 값이 달라질 수 있는 속성.저장 자료형과 측정척도, 분석 역할을 따로 구분한다.
모집단population결론을 적용하려는 전체 대상 집합.표본틀과 실제 모집단이 일치하는지 확인한다.
표본sample모집단에서 실제로 관측한 부분집합.크기뿐 아니라 추출·누락·비응답 구조가 중요하다.
명목척도nominal scale같고 다름만 의미 있는 범주 척도.숫자 코드의 대소를 해석하지 않는다.
순서척도ordinal scale범주 간 순서는 있지만 간격이 보장되지 않는 척도.평균 해석에는 동일 간격이라는 추가 가정이 필요하다.
기술통계descriptive statistics관측 자료의 중심·산포·분포·관계를 요약하는 방법.모집단 일반화나 인과 결론을 자동으로 제공하지 않는다.
평균mean값의 합을 관측 수로 나눈 균형점.극단값에 민감하며 제곱오차를 최소화한다.
중앙값median정렬된 자료의 가운데 위치.치우친 분포와 극단값에 평균보다 강건하다.
분산variance평균으로부터 제곱 편차의 평균 또는 표본 추정량.단위가 원 단위의 제곱이므로 표준편차와 구분한다.
표준편차standard deviation원자료 값들의 전형적 산포를 원 단위로 나타낸 값.추정량 변동인 표준오차와 다르다.
사분위범위interquartile range, IQRQ3-Q1로 정의되는 가운데 50%의 폭.1.5 IQR 밖 관측은 자동 삭제가 아닌 검토 후보다.
왜도skewness분포 비대칭의 방향과 정도를 나타내는 지표.작은 표본에서는 불안정하므로 그림과 함께 본다.
첨도kurtosis분포 꼬리와 극단값 민감성을 반영하는 표준화 모멘트.단순히 봉우리 높이라고만 해석하지 않는다.
상관계수correlation coefficient두 변수의 표준화된 선형 또는 순위 관계 지표.상관은 비선형 관계 부재나 인과관계를 보장하지 않는다.

확률과 추론

한국어English / 약어정의구분·주의
표본공간sample space확률실험에서 가능한 모든 결과의 집합.사건은 표본공간의 부분집합이다.
조건부확률conditional probability사건 B가 주어졌을 때 사건 A의 확률 P(AB).
독립independence한 사건의 정보가 다른 사건 확률을 바꾸지 않는 관계.배타적 사건과 구분한다.
베이즈 정리Bayes theorem사전확률과 우도로 관측 후 사후확률을 계산하는 규칙.희귀 사건에서는 기저율이 결과를 크게 좌우한다.
확률변수random variable확률실험 결과를 수치에 대응시키는 함수.이산형과 연속형의 확률 표현이 다르다.
확률질량함수probability mass function, PMF이산 확률변수 각 값의 확률.모든 가능한 값의 확률 합은 1이다.
확률밀도함수probability density function, PDF연속 확률변수의 구간 확률을 면적으로 주는 함수.한 점의 밀도 높이를 확률로 해석하지 않는다.
누적분포함수cumulative distribution function, CDFF(x)=P(X≤x)로 정의되는 누적확률 함수.이산·연속 분포 모두에 정의된다.
기댓값expected value확률로 가중한 장기 평균의 이론값.한 번의 관측 결과와 같다는 뜻은 아니다.
중심극한정리central limit theorem, CLT조건 아래 표본합·평균의 표본분포가 정규에 가까워지는 정리.원자료 자체가 정규가 된다는 뜻이 아니다.
표본분포sampling distribution같은 절차로 반복 표본을 뽑을 때 통계량이 만드는 분포.원자료 분포와 구분한다.
표준오차standard error추정량 표본분포의 표준편차 또는 그 추정값.평균의 경우 대략 s/√n이다.
신뢰구간confidence interval반복표집에서 정해진 비율로 모수를 포함하도록 만든 구간 절차의 결과.특정 실현 구간에 모수가 있을 확률로 해석하지 않는다.
귀무가설null hypothesis, H0가설검정에서 기준이 되는 데이터 생성 주장.단순히 믿고 싶은 기본 가설을 뜻하지 않는다.
p값p-valueH0 아래 관측값 이상으로 극단적인 검정통계량이 나올 확률.H0가 참일 확률이나 효과 크기가 아니다.
검정력statistical power실제 효과가 있을 때 H0를 기각할 확률 1-β.표본 수·효과 크기·변동성·alpha에 좌우된다.
효과크기effect size집단 차이 또는 관계의 실질적 크기를 나타내는 지표.통계적 유의성과 별도로 보고한다.

전처리·회귀·평가

한국어English / 약어정의구분·주의
결측 메커니즘missingness mechanism결측 발생을 MCAR·MAR·MNAR로 설명하는 개념적 구조.처리법 선택과 불확실성 해석에 영향을 준다.
이상치outlier다른 관측과 크게 다른 드문 값.오류·희귀 정상·목표 사건을 구분한다.
데이터 누수data leakage평가 또는 미래 정보가 학습·선택 단계에 들어가는 문제.전처리 fit과 리샘플링도 학습 폴드 안에서 수행한다.
표준화standardization평균을 빼고 표준편차로 나누는 스케일 변환.통계량은 학습 자료에서만 추정한다.
잔차residual관측값에서 적합값을 뺀 표본 수준의 차이.모집단의 미관측 오차항과 구분한다.
최소제곱법ordinary least squares, OLS잔차제곱합을 최소화해 회귀계수를 추정하는 방법.이상치와 이분산에 민감할 수 있다.
결정계수R-squared, R²평균 기준모형 대비 표본 내 제곱오차 감소 비율.외삽·인과·새 자료 성능을 보장하지 않는다.
교차검증cross-validation, CV개발 자료를 여러 학습·검증 폴드로 나눠 일반화를 추정하는 절차.모든 전처리와 선택을 각 폴드 내부에서 수행한다.
혼동행렬confusion matrix실제·예측 클래스를 TP·FP·FN·TN으로 교차 집계한 표.정확도 하나보다 오류 종류를 직접 보여 준다.
정밀도precision양성 예측 중 실제 양성의 비율.거짓 양성 비용이 클 때 중요하다.
재현율recall, sensitivity실제 양성 중 양성으로 찾아낸 비율.거짓 음성 비용이 클 때 중요하다.
ROC-AUCarea under ROC curve임의의 양성이 음성보다 높은 점수를 받을 순위 확률과 연결된 지표.클래스 비율과 운영 임계값을 별도로 고려한다.
확률 보정probability calibration예측확률과 실제 발생률의 일치 정도.AUC가 높아도 보정이 나쁠 수 있다.

머신러닝과 고급 자료

한국어English / 약어정의구분·주의
로지스틱 회귀logistic regression로그오즈를 입력의 선형결합으로 모델링하는 분류 방법.계수 지수는 조건부 오즈비다.
K-최근접 이웃K-nearest neighbors, K-NN주변 K개 학습 사례로 예측하는 국소 방법.거리·스케일·차원 수에 민감하다.
서포트 벡터 머신support vector machine, SVM클래스 사이 여백을 최대화하는 경계 모형.C·커널·스케일을 검증으로 정한다.
지니 불순도Gini impurity분류 노드에서 클래스 혼합 정도를 나타내는 값.불순도 감소가 인과적 중요도는 아니다.
배깅bagging부트스트랩 표본의 여러 모델을 평균·투표하는 병렬 앙상블.불안정한 학습기의 분산을 줄인다.
부스팅boosting이전 모델 오류를 순차적으로 보완하는 앙상블.학습률·트리 수·깊이를 함께 조절한다.
군집화clustering레이블 없이 유사한 관측치를 그룹으로 묶는 탐색 방법.내부 지표 외 안정성·도메인 해석이 필요하다.
주성분분석principal component analysis, PCA분산이 큰 직교 축으로 수치형 차원을 줄이는 방법.관측치 그룹을 직접 만드는 군집화와 다르다.
설명분산비explained variance ratio각 주성분이 전체 분산 중 설명하는 비율.예측 중요도나 인과 중요도와 같지 않다.
역전파backpropagation연쇄법칙으로 신경망 손실의 파라미터별 기울기를 계산하는 알고리즘.가중치 갱신 규칙 자체는 옵티마이저가 담당한다.
활성화함수activation function뉴런 가중합에 비선형성을 부여하는 함수.출력층 함수는 목표와 손실에 맞춘다.
과적합overfitting학습 자료 잡음까지 맞춰 새 자료 성능이 나빠지는 현상.학습·검증 차이와 독립 평가로 진단한다.
정규화regularization모형 복잡도에 벌점을 주거나 제약해 일반화를 돕는 방법.전처리의 normalization과 문맥을 구분한다.
정상성stationarity시계열 평균·분산·자기공분산 구조가 시간에 따라 일정한 성질.ARIMA 적용 전 차분·변환 필요성과 연결된다.
자기상관autocorrelation한 시계열과 그 시차 값 사이의 상관.공통 추세만으로도 크게 나타날 수 있다.
ARIMAautoregressive integrated moving average자기회귀·차분·이동평균을 결합한 시계열 모형군.차수 선택 후 잔차가 백색잡음인지 확인한다.

용어를 공부하는 방법

  1. 정의에서 대상이 관측값·표본·모집단·모형 중 무엇인지 표시한다.
  2. 비슷한 용어와 산출물이 어떻게 다른지 비교한다.
  3. 공식이 있다면 각 기호의 단위와 확률적 역할을 적는다.
  4. 가정이 깨질 때 계산값과 결론이 어느 방향으로 바뀔 수 있는지 설명한다.
  5. 자신의 데이터 사례로 올바른 문장과 잘못된 문장을 하나씩 만든다.

총 61개 핵심 용어를 수록했다.