Stat & ML

II. 확률과 통계적 추론 / M06

확률분포와 요약량

7 minv1.0.0검토 2026-07-21
이 문서의 목차

학습목표

  • 확률분포와 요약량의 대상·가정·산출물을 설명한다.
  • 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
  • Python으로 재현 가능한 점검의 출발점을 만든다.

핵심 용어

PMF · PDF · CDF · 기댓값 expected value · 이항 binomial · 포아송 Poisson · 정규 normal
한·영 정의와 약어는 통합 용어집을 함께 참조한다.

개념 설명

확률분포는 가능한 값과 불확실성을 기술한다. 이산형은 특정 값 확률을 더하고 연속형은 구간 아래 면적으로 해석한다. 이항은 독립 성공 횟수, 포아송은 구간 사건 수, 정규는 대칭 연속 변동의 대표 모형이며 이름보다 조건을 확인한다.

상세 이론

PMF·PDF·CDF

확률질량함수는 이산 값 각각의 확률이고 합이 1이다. 확률밀도함수는 높이 자체가 확률이 아니라 구간 적분이 확률이며 전체 면적이 1이다. 누적분포함수 F(x)=P(X≤x)는 이산·연속 모두에 정의되고 감소하지 않으며 극한이 0과 1이다.

기댓값·분산·공분산

기댓값은 확률 가중 평균이고 선형성 E[aX+bY]=aE[X]+bE[Y]는 독립 여부와 무관하다. 분산은 E[X²]-E[X]²이며 위치 이동에는 변하지 않고 배율의 제곱만큼 변한다. 독립 변수 합의 분산은 분산의 합이지만 일반적으로는 공분산 항을 더해야 한다.

베르누이·이항분포

베르누이 변수는 성공 1과 실패 0을 가지며 평균 p, 분산 p(1-p)다. 독립이고 성공확률이 일정한 n회 베르누이 합이 이항분포다. 복원 없는 추출이나 시행별 확률 변화에서는 이항 가정이 깨지며 초기하분포 같은 다른 모형이 필요하다.

포아송·지수분포

포아송분포는 일정 시간·공간에서 독립적으로 발생하는 사건 수를 평균률 λ로 모델링하며 평균과 분산이 λ다. 사건률이 일정한 포아송 과정에서 다음 사건까지 대기시간은 지수분포를 따른다. 실제 계수자료에서 분산이 평균보다 훨씬 크면 군집·이질성에 따른 과산포를 의심한다.

정규분포와 표준정규화

정규분포는 평균과 분산으로 정해지는 대칭 종 모양 분포다. 선형결합과 표본평균 근사에서 핵심이지만 모든 연속 자료가 정규라는 뜻은 아니다. z=(x-μ)/σ로 표준정규에 옮기면 서로 다른 평균·단위의 꼬리확률을 공통 표로 계산할 수 있다.

t·카이제곱·F 분포

모분산을 모르고 표본표준편차로 평균을 표준화하면 정규모집단에서 t분포가 나타난다. 정규변수 제곱합은 카이제곱분포와 연결되고, 독립 카이제곱을 자유도로 나눈 비율은 F분포가 된다. 이 세 분포는 평균·분산·분산비·ANOVA 검정통계량의 표본 불확실성을 표현한다.

개념 비교표

개념핵심 역할함께 구분할 개념
PMF·PDF·CDF확률질량함수는 이산 값 각각의 확률이고 합이 1이다.기댓값·분산·공분산
기댓값·분산·공분산기댓값은 확률 가중 평균이고 선형성 E[aX+bY]=aE[X]+bE[Y]는 독립 여부와 무관하다.베르누이·이항분포
베르누이·이항분포베르누이 변수는 성공 1과 실패 0을 가지며 평균 p, 분산 p(1-p)다.포아송·지수분포
포아송·지수분포포아송분포는 일정 시간·공간에서 독립적으로 발생하는 사건 수를 평균률 λ로 모델링하며 평균과 분산이 λ다.정규분포와 표준정규화
정규분포와 표준정규화정규분포는 평균과 분산으로 정해지는 대칭 종 모양 분포다.t·카이제곱·F 분포
t·카이제곱·F 분포모분산을 모르고 표본표준편차로 평균을 표준화하면 정규모집단에서 t분포가 나타난다.PMF·PDF·CDF

적용 조건과 진단

다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.

  • 이산·연속을 구분했는가
  • 분포의 생성 조건이 맞는가
  • 모수와 표본 통계량을 구분했는가

개념 흐름

이산 확률질량과 연속 확률밀도는 해석 단위가 다르다.

그림. 이산 확률질량과 연속 확률밀도는 해석 단위가 다르다.

공식과 해석

E[X]=xP(X=x)E[X]=\sum xP(X=x), Var(X)=E[(XE[X])2]Var(X)=E[(X-E[X])^2], Bin(n,p)Bin(n,p)의 평균은 npnp다.

계산 예제

성공확률 0.2인 10회 독립 시행의 기대 성공 수는 2이고, 실제 한 번의 결과가 2라는 뜻은 아니다.

Python 예제

실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.

from scipy.stats import binom, norm

n, p = 10, .2
exact_two = binom.pmf(2, n, p)
at_most_two = binom.cdf(2, n, p)
z = (70-60)/10
tail = 1 - norm.cdf(z)
print(exact_two, at_most_two)
print('평균/분산:', n*p, n*p*(1-p))
print('꼬리확률:', tail)

장 요약

  • PMF·PDF·CDF: 확률질량함수는 이산 값 각각의 확률이고 합이 1이다.
  • 기댓값·분산·공분산: 기댓값은 확률 가중 평균이고 선형성 E[aX+bY]=aE[X]+bE[Y]는 독립 여부와 무관하다.
  • 베르누이·이항분포: 베르누이 변수는 성공 1과 실패 0을 가지며 평균 p, 분산 p(1-p)다.
  • 포아송·지수분포: 포아송분포는 일정 시간·공간에서 독립적으로 발생하는 사건 수를 평균률 λ로 모델링하며 평균과 분산이 λ다.
  • 정규분포와 표준정규화: 정규분포는 평균과 분산으로 정해지는 대칭 종 모양 분포다.
  • t·카이제곱·F 분포: 모분산을 모르고 표본표준편차로 평균을 표준화하면 정규모집단에서 t분포가 나타난다.

더 읽을거리