학습목표
- 일변량 기술통계의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
도수분포 frequency distribution · 평균 mean · 중앙값 median · IQR · 표준편차 standard deviation · z점수
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
일변량 탐색은 전형적인 값뿐 아니라 흩어짐·꼬리·봉우리·빈 구간을 묻는다. 평균은 극단값에 민감하고 중앙값은 치우친 분포에서 더 안정적일 수 있다. 표준화는 단위가 다른 변수의 상대 위치를 비교하는 변환이며 큰 z점수는 오류가 아니라 검토 후보를 뜻한다.
상세 이론
도수분포와 경험적 분포
도수표는 값 또는 구간별 관측 수를, 상대도수는 전체에서 차지하는 비율을 보여 준다. 연속형 자료의 히스토그램은 구간 경계와 폭에 따라 모양이 달라지므로 한 가지 구간만 보고 봉우리 수를 단정하지 않는다. 경험적 누적분포는 특정 값 이하의 비율을 직접 보여 주어 분위수와 꼬리 확률을 읽는 데 유용하다.
산술평균·중앙값·최빈값
산술평균은 모든 값의 합을 관측 수로 나누며 편차의 합이 0이 되는 균형점이다. 중앙값은 순위의 가운데이고 최빈값은 가장 자주 나타난 값이다. 대칭 단봉 분포에서는 세 값이 비슷하지만 오른쪽 꼬리가 길면 보통 최빈값, 중앙값, 평균 순으로 커진다. 평균은 제곱오차를, 중앙값은 절대오차를 최소화한다는 최적화 관점도 중요하다.
범위·분산·표준편차
범위는 최대와 최소의 차이여서 간단하지만 두 값에만 의존한다. 분산은 평균에서 떨어진 거리의 제곱을 평균내어 큰 편차에 더 큰 가중을 주고, 표준편차는 원래 단위로 되돌린 값이다. 표본분산 분모의 n-1은 표본평균을 같은 자료에서 추정해 자유도 하나를 사용한 편향 보정과 연결된다. 단위가 다른 변수의 표준편차를 직접 비교해서는 안 된다.
분위수·사분위범위·상자그림
p분위수는 관측값의 p 비율이 그 값 이하가 되도록 하는 위치다. Q1과 Q3 사이 IQR은 가운데 50%의 폭으로 극단값에 강건하다. 상자그림의 수염 밖 점은 1.5 IQR 규칙에 따른 후보이지 오류 판정이 아니다. 그룹별 상자그림에서는 중앙값, IQR, 표본 수, 분포 비대칭을 함께 읽는다.
표준화와 변동계수
z점수는 각 값을 평균에서 몇 표준편차 떨어졌는지 표현한다. 서로 다른 단위의 상대 위치 비교와 거리 기반 모델의 스케일 조정에 유용하지만, 분포가 매우 비대칭이면 z=3 규칙의 확률 해석이 부정확하다. 변동계수 CV=s/평균은 비율척도에서 상대 변동성을 비교하지만 평균이 0에 가깝거나 음수이면 불안정하다.
왜도·첨도와 분포 모양
왜도는 비대칭 방향과 정도를, 첨도는 평균 주변 집중도라기보다 꼬리의 무거움과 극단값 민감성을 반영한다. 표본 왜도·첨도는 작은 표본에서 불안정하므로 히스토그램, Q-Q 그림, 분위수와 같이 본다. 로그 변환은 양수이며 오른쪽 꼬리가 긴 자료의 비대칭과 분산 증가를 줄일 수 있지만 원래 단위 해석을 바꾼다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 도수분포와 경험적 분포 | 도수표는 값 또는 구간별 관측 수를, 상대도수는 전체에서 차지하는 비율을 보여 준다. | 산술평균·중앙값·최빈값 |
| 산술평균·중앙값·최빈값 | 산술평균은 모든 값의 합을 관측 수로 나누며 편차의 합이 0이 되는 균형점이다. | 범위·분산·표준편차 |
| 범위·분산·표준편차 | 범위는 최대와 최소의 차이여서 간단하지만 두 값에만 의존한다. | 분위수·사분위범위·상자그림 |
| 분위수·사분위범위·상자그림 | p분위수는 관측값의 p 비율이 그 값 이하가 되도록 하는 위치다. | 표준화와 변동계수 |
| 표준화와 변동계수 | z점수는 각 값을 평균에서 몇 표준편차 떨어졌는지 표현한다. | 왜도·첨도와 분포 모양 |
| 왜도·첨도와 분포 모양 | 왜도는 비대칭 방향과 정도를, 첨도는 평균 주변 집중도라기보다 꼬리의 무거움과 극단값 민감성을 반영한다. | 도수분포와 경험적 분포 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 그래프와 수치를 함께 보았는가
- 극단값 처리 전에 원인을 확인했는가
- 평균·표준편차가 적합한 분포인가
개념 흐름

그림. 히스토그램과 상자그림으로 중심·산포·치우침을 함께 읽는다.
공식과 해석
, , 이다.
계산 예제
2,4,4,6,14의 평균은 6·중앙값은 4다. 14를 50으로 바꾸면 평균은 크게 변하지만 중앙값은 유지된다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
import pandas as pd
x = pd.Series([2,4,4,6,14])
q1, q3 = x.quantile([.25,.75])
iqr = q3 - q1
z = (x - x.mean()) / x.std(ddof=1)
print(x.describe())
print('IQR:', iqr)
print('z:', z.round(2).tolist())
# 이상치는 자동 삭제하지 않는다.
장 요약
- 도수분포와 경험적 분포: 도수표는 값 또는 구간별 관측 수를, 상대도수는 전체에서 차지하는 비율을 보여 준다.
- 산술평균·중앙값·최빈값: 산술평균은 모든 값의 합을 관측 수로 나누며 편차의 합이 0이 되는 균형점이다.
- 범위·분산·표준편차: 범위는 최대와 최소의 차이여서 간단하지만 두 값에만 의존한다.
- 분위수·사분위범위·상자그림: p분위수는 관측값의 p 비율이 그 값 이하가 되도록 하는 위치다.
- 표준화와 변동계수: z점수는 각 값을 평균에서 몇 표준편차 떨어졌는지 표현한다.
- 왜도·첨도와 분포 모양: 왜도는 비대칭 방향과 정도를, 첨도는 평균 주변 집중도라기보다 꼬리의 무거움과 극단값 민감성을 반영한다.