학습목표
- 검정 선택과 해석의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
독립 t검정 · 대응 t검정 · ANOVA · 카이제곱 검정 · 비모수 검정
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
검정 선택은 이름보다 질문 구조에서 시작한다. 두 독립 평균에는 독립 t, 같은 사람 전후에는 대응 t, 세 집단 이상에는 ANOVA, 범주형 관련성에는 카이제곱을 고려한다. 정규성·등분산성·독립성은 결과 뒤에 붙이는 장식이 아니다.
상세 이론
검정 선택의 네 질문
결과변수는 연속·범주·순서 중 무엇인지, 비교 집단 수는 몇 개인지, 관측이 독립인지 대응인지, 모수 가정이 합리적인지를 먼저 묻는다. 같은 평균 비교라도 독립 두 집단, 같은 대상 전후, 세 집단 이상은 표본분포가 다르다. 검정 이름보다 자료 생성 구조를 그리는 습관이 중요하다.
한 표본·두 표본 t검정
한 표본 t검정은 표본평균과 기준값의 차이를, 독립 두 표본 t검정은 두 모집단 평균 차이를 평가한다. 분산이 같다는 근거가 없으면 Welch t검정이 일반적으로 안전하다. 정규성 가정은 원자료보다 평균 차이의 표본분포에 관련되며 작은 표본·강한 이상치에서는 민감하다.
대응표본 검정
대응 t검정은 두 시점 값을 따로 비교하지 않고 개인별 차이 d를 한 표본 문제로 분석한다. 개인 수준의 고정된 차이를 제거해 정밀도가 높아질 수 있지만, 전후 변화가 처치 때문이라는 인과 결론에는 동시기 사건과 회귀효과를 통제한 대조군이 필요하다. 차이값 분포와 이상치를 진단한다.
ANOVA와 분산 분해
일원 ANOVA는 전체 변동을 집단 간 변동과 집단 내 변동으로 나누고 두 평균제곱의 비 F를 계산한다. H0 기각은 모든 평균이 같지 않다는 뜻이며 어느 집단이 다른지는 사후비교로 확인한다. 여러 t검정을 반복하는 것보다 가족오류율을 통제하는 장점이 있다.
카이제곱 검정
독립성 검정은 교차표 관측빈도 O와 독립 가정 아래 기대빈도 E의 차이를 χ²로 합산한다. 기대빈도가 너무 작으면 카이제곱 근사가 부정확해 Fisher 정확검정이나 범주 통합을 고려한다. 유의성 외에 Cramér V 같은 연관 강도와 조건부 비율을 보고한다.
비모수·순위 검정
Mann-Whitney, Wilcoxon signed-rank, Kruskal-Wallis는 값 자체보다 순위를 이용해 이상치와 비정규성에 덜 민감할 수 있다. 그러나 가정이 없는 검정은 아니며 독립성, 대칭성 또는 분포 모양 조건에 따라 해석이 달라진다. 중앙값 검정으로 단순화하기 전에 검정이 실제로 비교하는 확률·분포 위치를 확인한다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 검정 선택의 네 질문 | 결과변수는 연속·범주·순서 중 무엇인지, 비교 집단 수는 몇 개인지, 관측이 독립인지 대응인지, 모수 가정이 합리적인지를 먼저 묻는다. | 한 표본·두 표본 t검정 |
| 한 표본·두 표본 t검정 | 한 표본 t검정은 표본평균과 기준값의 차이를, 독립 두 표본 t검정은 두 모집단 평균 차이를 평가한다. | 대응표본 검정 |
| 대응표본 검정 | 대응 t검정은 두 시점 값을 따로 비교하지 않고 개인별 차이 d를 한 표본 문제로 분석한다. | ANOVA와 분산 분해 |
| ANOVA와 분산 분해 | 일원 ANOVA는 전체 변동을 집단 간 변동과 집단 내 변동으로 나누고 두 평균제곱의 비 F를 계산한다. | 카이제곱 검정 |
| 카이제곱 검정 | 독립성 검정은 교차표 관측빈도 O와 독립 가정 아래 기대빈도 E의 차이를 χ²로 합산한다. | 비모수·순위 검정 |
| 비모수·순위 검정 | Mann-Whitney, Wilcoxon signed-rank, Kruskal-Wallis는 값 자체보다 순위를 이용해 이상치와 비정규성에 덜 민감할 수 있다. | 검정 선택의 네 질문 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 독립·대응 구조를 맞게 지정했는가
- 기대빈도·분포·등분산 조건을 확인했는가
- 다중비교를 통제했는가
개념 흐름
공식과 해석
대응 t는 , 카이제곱은 다.
계산 예제
8명의 전후 차이 평균 4, 표준편차 5면 SE는 약 1.77, t는 약 2.26이다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
from scipy.stats import ttest_rel
before = [60,65,70,72,68,75]
after = [63,66,74,73,72,78]
stat, p_value = ttest_rel(after, before)
print('대응 t:', round(stat,3))
print('p:', round(p_value,4))
print('차이 평균:', sum(a-b for a,b in zip(after,before))/len(before))
print('대응 구조를 보존했다.')
# 가정과 효과크기도 확인한다.
장 요약
- 검정 선택의 네 질문: 결과변수는 연속·범주·순서 중 무엇인지, 비교 집단 수는 몇 개인지, 관측이 독립인지 대응인지, 모수 가정이 합리적인지를 먼저 묻는다.
- 한 표본·두 표본 t검정: 한 표본 t검정은 표본평균과 기준값의 차이를, 독립 두 표본 t검정은 두 모집단 평균 차이를 평가한다.
- 대응표본 검정: 대응 t검정은 두 시점 값을 따로 비교하지 않고 개인별 차이 d를 한 표본 문제로 분석한다.
- ANOVA와 분산 분해: 일원 ANOVA는 전체 변동을 집단 간 변동과 집단 내 변동으로 나누고 두 평균제곱의 비 F를 계산한다.
- 카이제곱 검정: 독립성 검정은 교차표 관측빈도 O와 독립 가정 아래 기대빈도 E의 차이를 χ²로 합산한다.
- 비모수·순위 검정: Mann-Whitney, Wilcoxon signed-rank, Kruskal-Wallis는 값 자체보다 순위를 이용해 이상치와 비정규성에 덜 민감할 수 있다.