Stat & ML

I. 데이터와 통계적 사고 / M01

데이터·변수·표본의 언어

8 minv1.0.0검토 2026-07-21
이 문서의 목차

학습목표

  • 데이터·변수·표본의 언어의 대상·가정·산출물을 설명한다.
  • 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
  • Python으로 재현 가능한 점검의 출발점을 만든다.

핵심 용어

관측값 observation · 변수 variable · 모집단 population · 표본 sample · 측정척도 measurement scale
한·영 정의와 약어는 통합 용어집을 함께 참조한다.

개념 설명

데이터의 행은 관측 단위, 열은 변수다. 분석 전에 관측 단위·기간·식별자를 정해야 중복과 시간 단위 혼동을 막는다. 명목·순서·등간·비율척도는 허용하는 비교가 다르며, 숫자로 저장된 만족도도 순서형일 수 있다. 기술통계는 표본을 요약하고 추론통계는 표본오차와 가정 아래 모집단에 관해 말한다.

상세 이론

관측 단위와 분석 단위

관측 단위는 데이터 한 행이 대표하는 대상이다. 고객, 고객-월, 거래는 서로 다른 단위이며 같은 열 이름을 가져도 해석이 달라진다. 분석 단위가 질문과 일치하지 않으면 한 고객의 다수 거래가 독립 표본처럼 계산되는 의사반복 문제가 생긴다. 따라서 데이터 사전에는 단위, 관측 기간, 포함·제외 기준, 중복 판정 키를 함께 기록한다.

변수의 역할과 자료형

변수는 식별자, 설명변수, 목표변수, 층화·그룹 변수, 시간·공간 인덱스처럼 분석에서 맡는 역할로도 구분한다. 저장 자료형과 통계적 자료형은 다를 수 있다. 우편번호는 정수로 저장되어도 명목형이고, 날짜 문자열은 시간 순서를 가진 자료로 변환해야 한다. 역할을 잘못 지정하면 식별자가 예측변수로 들어가 누수를 만들거나 목표변수의 사후 정보가 입력에 섞인다.

측정척도의 네 수준

명목척도는 같고 다름, 순서척도는 대소 순서, 등간척도는 차이, 비율척도는 절대적 0과 비율 비교까지 허용한다. 척도는 계산 가능성과 해석 가능성을 구분하는 기준이다. 순서형 만족도에 평균을 계산할 수는 있지만 범주 간 간격이 같다는 추가 가정이 필요하다. 온도 섭씨 20도가 10도의 두 배로 따뜻하다고 말할 수 없는 것도 절대적 0이 없기 때문이다.

모집단·표본·표본틀

모집단은 결론을 적용하려는 전체 대상이고 표본은 실제 관측 부분이다. 표본틀은 표본을 뽑을 수 있는 명단이나 접근 경로이며 모집단과 일치하지 않을 수 있다. 온라인 설문 링크에 접근한 사람만 응답했다면 표본 수가 커도 비응답·자기선택 편향이 남는다. 추론의 타당성은 표본 크기뿐 아니라 표본틀의 포괄성과 추출 절차에 달려 있다.

표본추출과 대표성

단순무작위추출은 각 단위에 알려진 선택 가능성을 부여하고, 층화추출은 중요한 하위 집단을 층으로 나눠 정밀도를 높인다. 군집추출은 자연 집단을 뽑아 비용을 줄이지만 군집 내부 유사성 때문에 유효 표본 크기가 작아질 수 있다. 편의표본은 빠르지만 모집단 일반화 근거가 약하다. 시험에서는 추출법의 이름뿐 아니라 비용·대표성·분산의 절충을 연결해 이해해야 한다.

기술통계와 추론통계

기술통계는 관측한 표본의 빈도, 중심, 산포, 관계를 압축한다. 추론통계는 확률모형과 표본추출 가정 아래 모집단 모수 또는 미래 관측에 대한 불확실성을 평가한다. 같은 평균 72라도 표본 설명에서는 사실 요약이지만, 모집단 평균 추정에서는 표준오차와 신뢰구간이 필요하다. 기술통계는 추론 전에 자료 품질과 가정 위반을 발견하는 필수 단계다.

개념 비교표

개념핵심 역할함께 구분할 개념
관측 단위와 분석 단위관측 단위는 데이터 한 행이 대표하는 대상이다.변수의 역할과 자료형
변수의 역할과 자료형변수는 식별자, 설명변수, 목표변수, 층화·그룹 변수, 시간·공간 인덱스처럼 분석에서 맡는 역할로도 구분한다.측정척도의 네 수준
측정척도의 네 수준명목척도는 같고 다름, 순서척도는 대소 순서, 등간척도는 차이, 비율척도는 절대적 0과 비율 비교까지 허용한다.모집단·표본·표본틀
모집단·표본·표본틀모집단은 결론을 적용하려는 전체 대상이고 표본은 실제 관측 부분이다.표본추출과 대표성
표본추출과 대표성단순무작위추출은 각 단위에 알려진 선택 가능성을 부여하고, 층화추출은 중요한 하위 집단을 층으로 나눠 정밀도를 높인다.기술통계와 추론통계
기술통계와 추론통계기술통계는 관측한 표본의 빈도, 중심, 산포, 관계를 압축한다.관측 단위와 분석 단위

적용 조건과 진단

다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.

  • 관측 단위와 질문이 일치하는가
  • 표본틀이 목표 모집단을 포함하는가
  • 저장 자료형과 측정척도를 구분했는가

개념 흐름

공식과 해석

xˉ=xi/n\bar{x}=\sum x_i/n은 표본 요약값이며 모집단 평균 μ\mu와 같다고 단정하지 않는다.

계산 예제

구매액 10,12,12,15,51의 평균은 20, 중앙값은 12다. 고액 값의 맥락을 확인하고 둘을 함께 보고한다.

Python 예제

실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.

import pandas as pd

df = pd.DataFrame({'segment': ['A','B','A'], 'spend': [10,12,51]})
dictionary = pd.DataFrame({'variable': df.columns, 'scale': ['명목','비율']})
print(dictionary)
print(df['spend'].mean(), df['spend'].median())
print('관측 단위: 고객')
print('모집단 정의를 기록한다.')
print('표본의 범위를 확인한다.')
# 변수의 역할과 척도를 먼저 적는다.

장 요약

  • 관측 단위와 분석 단위: 관측 단위는 데이터 한 행이 대표하는 대상이다.
  • 변수의 역할과 자료형: 변수는 식별자, 설명변수, 목표변수, 층화·그룹 변수, 시간·공간 인덱스처럼 분석에서 맡는 역할로도 구분한다.
  • 측정척도의 네 수준: 명목척도는 같고 다름, 순서척도는 대소 순서, 등간척도는 차이, 비율척도는 절대적 0과 비율 비교까지 허용한다.
  • 모집단·표본·표본틀: 모집단은 결론을 적용하려는 전체 대상이고 표본은 실제 관측 부분이다.
  • 표본추출과 대표성: 단순무작위추출은 각 단위에 알려진 선택 가능성을 부여하고, 층화추출은 중요한 하위 집단을 층으로 나눠 정밀도를 높인다.
  • 기술통계와 추론통계: 기술통계는 관측한 표본의 빈도, 중심, 산포, 관계를 압축한다.

더 읽을거리