학습목표
- 표본분포와 추정의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
표본분포 sampling distribution · CLT · 표준오차 standard error · 점추정 · 신뢰구간 confidence interval
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
반복 표본추출로 얻은 평균들의 분포가 표본분포다. 표준오차는 추정량의 표본 간 흔들림으로 원자료 표준편차와 다르다. 95% 신뢰구간은 같은 절차를 반복할 때 만들어진 구간의 약 95%가 고정된 모수를 포함한다는 성질이다.
상세 이론
통계량과 표본분포
통계량은 표본만으로 계산되는 함수이며 표본평균, 표본분산, 표본비율이 대표적이다. 표본이 바뀌면 통계량도 바뀌므로 확률변수로 취급한다. 표본분포는 원자료 분포가 아니라 같은 절차를 반복했을 때 통계량이 만드는 분포이며 추정·검정의 기준이 된다.
중심극한정리의 조건과 범위
독립이고 같은 분포에서 뽑힌 유한분산 관측의 합 또는 평균은 표본 수가 커질수록 정규분포에 가까워진다. 필요한 표본 크기는 원분포의 왜도·꼬리에 따라 다르며 극단적으로 무거운 꼬리나 의존 자료에서는 단순 적용이 어렵다. CLT는 원자료가 정규가 된다는 정리가 아니다.
표준편차와 표준오차
표준편차는 개인 관측의 흩어짐이고 표준오차는 추정량의 반복표집 변동이다. 평균의 SE는 σ/√n이고 σ를 모르면 s/√n으로 추정한다. 표본 수를 4배 늘려야 SE가 절반이 되므로 정밀도 향상에는 비용이 따른다.
좋은 추정량의 성질
불편성은 반복 표본에서 추정량 평균이 모수와 같다는 성질이고, 일치성은 표본 수가 커질수록 모수에 가까워지는 성질이다. 효율성은 같은 조건의 추정량 중 분산이 작은 정도, 강건성은 이상치·가정 위반에 덜 민감한 정도다. 한 성질이 모든 상황에서 절대적으로 우월함을 뜻하지 않는다.
신뢰구간의 구성
일반적 신뢰구간은 점추정값 ± 임계값×표준오차 구조다. 임계값은 신뢰수준과 표본분포에, 표준오차는 산포와 표본 크기에 달려 있다. 평균의 모분산을 모르는 작은 표본에서는 t분포를 사용하고 자유도가 작을수록 꼬리가 두꺼워 구간이 넓어진다.
부트스트랩과 구간 해석
부트스트랩은 관측 표본을 모집단의 근사로 보고 복원추출을 반복해 통계량 분포를 근사한다. 해석적 표준오차가 어렵거나 중앙값 같은 통계량에 유용하지만 표본이 모집단을 대표한다는 전제가 사라지는 것은 아니다. 95% 신뢰수준은 특정 구간에 모수가 있을 주관적 확률이 아니라 구간 생성 절차의 장기 포괄률이다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 통계량과 표본분포 | 통계량은 표본만으로 계산되는 함수이며 표본평균, 표본분산, 표본비율이 대표적이다. | 중심극한정리의 조건과 범위 |
| 중심극한정리의 조건과 범위 | 독립이고 같은 분포에서 뽑힌 유한분산 관측의 합 또는 평균은 표본 수가 커질수록 정규분포에 가까워진다. | 표준편차와 표준오차 |
| 표준편차와 표준오차 | 표준편차는 개인 관측의 흩어짐이고 표준오차는 추정량의 반복표집 변동이다. | 좋은 추정량의 성질 |
| 좋은 추정량의 성질 | 불편성은 반복 표본에서 추정량 평균이 모수와 같다는 성질이고, 일치성은 표본 수가 커질수록 모수에 가까워지는 성질이다. | 신뢰구간의 구성 |
| 신뢰구간의 구성 | 일반적 신뢰구간은 점추정값 ± 임계값×표준오차 구조다. | 부트스트랩과 구간 해석 |
| 부트스트랩과 구간 해석 | 부트스트랩은 관측 표본을 모집단의 근사로 보고 복원추출을 반복해 통계량 분포를 근사한다. | 통계량과 표본분포 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 표본추출과 독립 가정이 타당한가
- 표준편차와 표준오차를 구분했는가
- 신뢰구간을 반복표집 절차로 해석했는가
개념 흐름

그림. 표본분포 폭은 원자료 산포와 표본 크기에 의해 달라진다.
공식과 해석
이며 큰 표본 근사 95% 구간은 다.
계산 예제
평균 72, 표준편차 10, n=25이면 SE=2, 근사 95% 구간은 [68.08,75.92]다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
import numpy as np
from scipy.stats import t
x = np.array([68,70,71,72,74,75,76,78])
se = x.std(ddof=1) / np.sqrt(len(x))
critical = t.ppf(.975, df=len(x)-1)
ci = (x.mean()-critical*se, x.mean()+critical*se)
print('SE:', round(se,2))
print('95% CI:', tuple(round(v,2) for v in ci))
# 반복표집 절차의 포괄률로 해석한다.
장 요약
- 통계량과 표본분포: 통계량은 표본만으로 계산되는 함수이며 표본평균, 표본분산, 표본비율이 대표적이다.
- 중심극한정리의 조건과 범위: 독립이고 같은 분포에서 뽑힌 유한분산 관측의 합 또는 평균은 표본 수가 커질수록 정규분포에 가까워진다.
- 표준편차와 표준오차: 표준편차는 개인 관측의 흩어짐이고 표준오차는 추정량의 반복표집 변동이다.
- 좋은 추정량의 성질: 불편성은 반복 표본에서 추정량 평균이 모수와 같다는 성질이고, 일치성은 표본 수가 커질수록 모수에 가까워지는 성질이다.
- 신뢰구간의 구성: 일반적 신뢰구간은 점추정값 ± 임계값×표준오차 구조다.
- 부트스트랩과 구간 해석: 부트스트랩은 관측 표본을 모집단의 근사로 보고 복원추출을 반복해 통계량 분포를 근사한다.