Stat & ML

II. 확률과 통계적 추론 / M05

확률의 기초

7 minv1.0.0검토 2026-07-21
이 문서의 목차

학습목표

  • 확률의 기초의 대상·가정·산출물을 설명한다.
  • 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
  • Python으로 재현 가능한 점검의 출발점을 만든다.

핵심 용어

표본공간 sample space · 사건 event · 조건부확률 conditional probability · 독립 independence · 베이즈 정리
한·영 정의와 약어는 통합 용어집을 함께 참조한다.

개념 설명

표본공간은 가능한 결과의 집합, 사건은 그 일부다. 독립은 P(AB)=P(A)P(B)P(A∩B)=P(A)P(B)가 성립하는 엄격한 관계다. 베이즈 정리는 검사 결과에서 실제 상태 확률로 방향을 바꾸며 민감도뿐 아니라 기저율을 반영한다.

상세 이론

표본공간·사건·확률 공리

표본공간은 가능한 결과 전체, 사건은 그 부분집합이다. 확률은 음수가 아니고 전체 공간의 확률은 1이며 서로 배타적인 사건의 합집합 확률은 확률의 합이라는 공리를 만족한다. 여집합, 합집합, 교집합을 집합 연산으로 다루면 덧셈법칙과 조건부확률을 일관되게 유도할 수 있다.

덧셈법칙과 포함-배제

두 사건 중 적어도 하나가 일어날 확률은 P(A)+P(B)-P(A∩B)다. 교집합을 빼는 이유는 두 확률에 중복 계산되었기 때문이다. 배타적 사건에서는 교집합이 공집합이라 단순 합이 되지만, 배타성과 독립은 서로 다른 개념이다.

조건부확률과 곱셈법칙

P(A|B)는 B가 일어난 세계로 표본공간을 제한한 뒤 A의 비율을 계산한다. 곱셈법칙 P(A∩B)=P(A|B)P(B)는 순차 사건과 확률나무를 계산하는 기본이다. 조건의 방향을 바꾸면 분모가 달라지므로 P(A|B)와 P(B|A)는 일반적으로 같지 않다.

독립성과 조건부 독립

A와 B가 독립이면 한 사건을 알아도 다른 사건 확률이 변하지 않는다. 조건부 독립은 제3의 변수 C가 주어졌을 때 독립인 관계로 나이브 베이즈와 그래프 모형의 핵심이다. 주변적으로 독립인 변수가 조건을 걸면 의존할 수도 있고, 반대로 공통 원인을 조건화하면 의존성이 사라질 수 있다.

베이즈 정리와 기저율

베이즈 정리는 사전확률과 우도를 결합해 관측 후 사후확률을 계산한다. 희귀 질병 검사에서는 민감도가 높아도 위양성이 실제 양성보다 많을 수 있다. 양성예측도는 검사 특성뿐 아니라 적용 집단의 유병률에 따라 달라지므로 다른 집단으로 그대로 옮길 수 없다.

확률변수와 지시변수

확률변수는 각 결과를 수치로 대응시키는 함수다. 이산형은 셀 수 있는 값, 연속형은 구간의 값을 취한다. 사건 A의 지시변수 I(A)는 사건이 일어나면 1, 아니면 0이며 기대값 E[I(A)]=P(A)다. 복잡한 사건 수의 기대값을 지시변수 합으로 계산하는 데 유용하다.

개념 비교표

개념핵심 역할함께 구분할 개념
표본공간·사건·확률 공리표본공간은 가능한 결과 전체, 사건은 그 부분집합이다.덧셈법칙과 포함-배제
덧셈법칙과 포함-배제두 사건 중 적어도 하나가 일어날 확률은 P(A)+P(B)-P(A∩B)다.조건부확률과 곱셈법칙
조건부확률과 곱셈법칙P(AB)는 B가 일어난 세계로 표본공간을 제한한 뒤 A의 비율을 계산한다.
독립성과 조건부 독립A와 B가 독립이면 한 사건을 알아도 다른 사건 확률이 변하지 않는다.베이즈 정리와 기저율
베이즈 정리와 기저율베이즈 정리는 사전확률과 우도를 결합해 관측 후 사후확률을 계산한다.확률변수와 지시변수
확률변수와 지시변수확률변수는 각 결과를 수치로 대응시키는 함수다.표본공간·사건·확률 공리

적용 조건과 진단

다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.

  • 조건부확률의 기준 집단을 명시했는가
  • 독립과 배타를 구분했는가
  • 기저율을 반영했는가

개념 흐름

공식과 해석

P(AB)=P(AB)/P(B)=P(BA)P(A)/P(B)P(A|B)=P(A∩B)/P(B)=P(B|A)P(A)/P(B)다.

계산 예제

유병률 1%, 민감도 90%, 특이도 95%이면 양성일 때 질병 확률은 약 15.4%다.

Python 예제

실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.

prevalence = .01
sensitivity = .90
specificity = .95

p_positive = sensitivity*prevalence + (1-specificity)*(1-prevalence)
posterior = sensitivity*prevalence / p_positive
print('양성 확률:', round(p_positive,3))
print('사후 확률:', round(posterior,3))
assert 0 <= posterior <= 1
print('기저율을 포함했다.')

장 요약

  • 표본공간·사건·확률 공리: 표본공간은 가능한 결과 전체, 사건은 그 부분집합이다.
  • 덧셈법칙과 포함-배제: 두 사건 중 적어도 하나가 일어날 확률은 P(A)+P(B)-P(A∩B)다.
  • 조건부확률과 곱셈법칙: P(A|B)는 B가 일어난 세계로 표본공간을 제한한 뒤 A의 비율을 계산한다.
  • 독립성과 조건부 독립: A와 B가 독립이면 한 사건을 알아도 다른 사건 확률이 변하지 않는다.
  • 베이즈 정리와 기저율: 베이즈 정리는 사전확률과 우도를 결합해 관측 후 사후확률을 계산한다.
  • 확률변수와 지시변수: 확률변수는 각 결과를 수치로 대응시키는 함수다.

더 읽을거리