이 용어집은 단어 번역뿐 아니라 정의, 인접 개념과의 경계, 해석상 주의점을 함께 제공한다. 장 본문의 첫 등장에서는 한국어와 영어를 병기하고, 여기서는 복습과 교차 참조에 사용한다.
데이터와 기술통계
| 한국어 | English / 약어 | 정의 | 구분·주의 |
|---|---|---|---|
| 관측 단위 | observation unit | 데이터 한 행이 대표하는 대상. 고객과 고객-월은 서로 다른 단위다. | 분석 질문과 단위가 다르면 의사반복과 잘못된 표본 수가 생긴다. |
| 변수 | variable | 관측 단위마다 값이 달라질 수 있는 속성. | 저장 자료형과 측정척도, 분석 역할을 따로 구분한다. |
| 모집단 | population | 결론을 적용하려는 전체 대상 집합. | 표본틀과 실제 모집단이 일치하는지 확인한다. |
| 표본 | sample | 모집단에서 실제로 관측한 부분집합. | 크기뿐 아니라 추출·누락·비응답 구조가 중요하다. |
| 명목척도 | nominal scale | 같고 다름만 의미 있는 범주 척도. | 숫자 코드의 대소를 해석하지 않는다. |
| 순서척도 | ordinal scale | 범주 간 순서는 있지만 간격이 보장되지 않는 척도. | 평균 해석에는 동일 간격이라는 추가 가정이 필요하다. |
| 기술통계 | descriptive statistics | 관측 자료의 중심·산포·분포·관계를 요약하는 방법. | 모집단 일반화나 인과 결론을 자동으로 제공하지 않는다. |
| 평균 | mean | 값의 합을 관측 수로 나눈 균형점. | 극단값에 민감하며 제곱오차를 최소화한다. |
| 중앙값 | median | 정렬된 자료의 가운데 위치. | 치우친 분포와 극단값에 평균보다 강건하다. |
| 분산 | variance | 평균으로부터 제곱 편차의 평균 또는 표본 추정량. | 단위가 원 단위의 제곱이므로 표준편차와 구분한다. |
| 표준편차 | standard deviation | 원자료 값들의 전형적 산포를 원 단위로 나타낸 값. | 추정량 변동인 표준오차와 다르다. |
| 사분위범위 | interquartile range, IQR | Q3-Q1로 정의되는 가운데 50%의 폭. | 1.5 IQR 밖 관측은 자동 삭제가 아닌 검토 후보다. |
| 왜도 | skewness | 분포 비대칭의 방향과 정도를 나타내는 지표. | 작은 표본에서는 불안정하므로 그림과 함께 본다. |
| 첨도 | kurtosis | 분포 꼬리와 극단값 민감성을 반영하는 표준화 모멘트. | 단순히 봉우리 높이라고만 해석하지 않는다. |
| 상관계수 | correlation coefficient | 두 변수의 표준화된 선형 또는 순위 관계 지표. | 상관은 비선형 관계 부재나 인과관계를 보장하지 않는다. |
확률과 추론
| 한국어 | English / 약어 | 정의 | 구분·주의 |
|---|---|---|---|
| 표본공간 | sample space | 확률실험에서 가능한 모든 결과의 집합. | 사건은 표본공간의 부분집합이다. |
| 조건부확률 | conditional probability | 사건 B가 주어졌을 때 사건 A의 확률 P(A | B). |
| 독립 | independence | 한 사건의 정보가 다른 사건 확률을 바꾸지 않는 관계. | 배타적 사건과 구분한다. |
| 베이즈 정리 | Bayes theorem | 사전확률과 우도로 관측 후 사후확률을 계산하는 규칙. | 희귀 사건에서는 기저율이 결과를 크게 좌우한다. |
| 확률변수 | random variable | 확률실험 결과를 수치에 대응시키는 함수. | 이산형과 연속형의 확률 표현이 다르다. |
| 확률질량함수 | probability mass function, PMF | 이산 확률변수 각 값의 확률. | 모든 가능한 값의 확률 합은 1이다. |
| 확률밀도함수 | probability density function, PDF | 연속 확률변수의 구간 확률을 면적으로 주는 함수. | 한 점의 밀도 높이를 확률로 해석하지 않는다. |
| 누적분포함수 | cumulative distribution function, CDF | F(x)=P(X≤x)로 정의되는 누적확률 함수. | 이산·연속 분포 모두에 정의된다. |
| 기댓값 | expected value | 확률로 가중한 장기 평균의 이론값. | 한 번의 관측 결과와 같다는 뜻은 아니다. |
| 중심극한정리 | central limit theorem, CLT | 조건 아래 표본합·평균의 표본분포가 정규에 가까워지는 정리. | 원자료 자체가 정규가 된다는 뜻이 아니다. |
| 표본분포 | sampling distribution | 같은 절차로 반복 표본을 뽑을 때 통계량이 만드는 분포. | 원자료 분포와 구분한다. |
| 표준오차 | standard error | 추정량 표본분포의 표준편차 또는 그 추정값. | 평균의 경우 대략 s/√n이다. |
| 신뢰구간 | confidence interval | 반복표집에서 정해진 비율로 모수를 포함하도록 만든 구간 절차의 결과. | 특정 실현 구간에 모수가 있을 확률로 해석하지 않는다. |
| 귀무가설 | null hypothesis, H0 | 가설검정에서 기준이 되는 데이터 생성 주장. | 단순히 믿고 싶은 기본 가설을 뜻하지 않는다. |
| p값 | p-value | H0 아래 관측값 이상으로 극단적인 검정통계량이 나올 확률. | H0가 참일 확률이나 효과 크기가 아니다. |
| 검정력 | statistical power | 실제 효과가 있을 때 H0를 기각할 확률 1-β. | 표본 수·효과 크기·변동성·alpha에 좌우된다. |
| 효과크기 | effect size | 집단 차이 또는 관계의 실질적 크기를 나타내는 지표. | 통계적 유의성과 별도로 보고한다. |
전처리·회귀·평가
| 한국어 | English / 약어 | 정의 | 구분·주의 |
|---|---|---|---|
| 결측 메커니즘 | missingness mechanism | 결측 발생을 MCAR·MAR·MNAR로 설명하는 개념적 구조. | 처리법 선택과 불확실성 해석에 영향을 준다. |
| 이상치 | outlier | 다른 관측과 크게 다른 드문 값. | 오류·희귀 정상·목표 사건을 구분한다. |
| 데이터 누수 | data leakage | 평가 또는 미래 정보가 학습·선택 단계에 들어가는 문제. | 전처리 fit과 리샘플링도 학습 폴드 안에서 수행한다. |
| 표준화 | standardization | 평균을 빼고 표준편차로 나누는 스케일 변환. | 통계량은 학습 자료에서만 추정한다. |
| 잔차 | residual | 관측값에서 적합값을 뺀 표본 수준의 차이. | 모집단의 미관측 오차항과 구분한다. |
| 최소제곱법 | ordinary least squares, OLS | 잔차제곱합을 최소화해 회귀계수를 추정하는 방법. | 이상치와 이분산에 민감할 수 있다. |
| 결정계수 | R-squared, R² | 평균 기준모형 대비 표본 내 제곱오차 감소 비율. | 외삽·인과·새 자료 성능을 보장하지 않는다. |
| 교차검증 | cross-validation, CV | 개발 자료를 여러 학습·검증 폴드로 나눠 일반화를 추정하는 절차. | 모든 전처리와 선택을 각 폴드 내부에서 수행한다. |
| 혼동행렬 | confusion matrix | 실제·예측 클래스를 TP·FP·FN·TN으로 교차 집계한 표. | 정확도 하나보다 오류 종류를 직접 보여 준다. |
| 정밀도 | precision | 양성 예측 중 실제 양성의 비율. | 거짓 양성 비용이 클 때 중요하다. |
| 재현율 | recall, sensitivity | 실제 양성 중 양성으로 찾아낸 비율. | 거짓 음성 비용이 클 때 중요하다. |
| ROC-AUC | area under ROC curve | 임의의 양성이 음성보다 높은 점수를 받을 순위 확률과 연결된 지표. | 클래스 비율과 운영 임계값을 별도로 고려한다. |
| 확률 보정 | probability calibration | 예측확률과 실제 발생률의 일치 정도. | AUC가 높아도 보정이 나쁠 수 있다. |
머신러닝과 고급 자료
| 한국어 | English / 약어 | 정의 | 구분·주의 |
|---|---|---|---|
| 로지스틱 회귀 | logistic regression | 로그오즈를 입력의 선형결합으로 모델링하는 분류 방법. | 계수 지수는 조건부 오즈비다. |
| K-최근접 이웃 | K-nearest neighbors, K-NN | 주변 K개 학습 사례로 예측하는 국소 방법. | 거리·스케일·차원 수에 민감하다. |
| 서포트 벡터 머신 | support vector machine, SVM | 클래스 사이 여백을 최대화하는 경계 모형. | C·커널·스케일을 검증으로 정한다. |
| 지니 불순도 | Gini impurity | 분류 노드에서 클래스 혼합 정도를 나타내는 값. | 불순도 감소가 인과적 중요도는 아니다. |
| 배깅 | bagging | 부트스트랩 표본의 여러 모델을 평균·투표하는 병렬 앙상블. | 불안정한 학습기의 분산을 줄인다. |
| 부스팅 | boosting | 이전 모델 오류를 순차적으로 보완하는 앙상블. | 학습률·트리 수·깊이를 함께 조절한다. |
| 군집화 | clustering | 레이블 없이 유사한 관측치를 그룹으로 묶는 탐색 방법. | 내부 지표 외 안정성·도메인 해석이 필요하다. |
| 주성분분석 | principal component analysis, PCA | 분산이 큰 직교 축으로 수치형 차원을 줄이는 방법. | 관측치 그룹을 직접 만드는 군집화와 다르다. |
| 설명분산비 | explained variance ratio | 각 주성분이 전체 분산 중 설명하는 비율. | 예측 중요도나 인과 중요도와 같지 않다. |
| 역전파 | backpropagation | 연쇄법칙으로 신경망 손실의 파라미터별 기울기를 계산하는 알고리즘. | 가중치 갱신 규칙 자체는 옵티마이저가 담당한다. |
| 활성화함수 | activation function | 뉴런 가중합에 비선형성을 부여하는 함수. | 출력층 함수는 목표와 손실에 맞춘다. |
| 과적합 | overfitting | 학습 자료 잡음까지 맞춰 새 자료 성능이 나빠지는 현상. | 학습·검증 차이와 독립 평가로 진단한다. |
| 정규화 | regularization | 모형 복잡도에 벌점을 주거나 제약해 일반화를 돕는 방법. | 전처리의 normalization과 문맥을 구분한다. |
| 정상성 | stationarity | 시계열 평균·분산·자기공분산 구조가 시간에 따라 일정한 성질. | ARIMA 적용 전 차분·변환 필요성과 연결된다. |
| 자기상관 | autocorrelation | 한 시계열과 그 시차 값 사이의 상관. | 공통 추세만으로도 크게 나타날 수 있다. |
| ARIMA | autoregressive integrated moving average | 자기회귀·차분·이동평균을 결합한 시계열 모형군. | 차수 선택 후 잔차가 백색잡음인지 확인한다. |
용어를 공부하는 방법
- 정의에서 대상이 관측값·표본·모집단·모형 중 무엇인지 표시한다.
- 비슷한 용어와 산출물이 어떻게 다른지 비교한다.
- 공식이 있다면 각 기호의 단위와 확률적 역할을 적는다.
- 가정이 깨질 때 계산값과 결론이 어느 방향으로 바뀔 수 있는지 설명한다.
- 자신의 데이터 사례로 올바른 문장과 잘못된 문장을 하나씩 만든다.
총 61개 핵심 용어를 수록했다.