학습목표
- 구조화된 고급 데이터의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
시계열 time series · 추세 · 계절성 · 자기상관 · 정상성 · ARIMA · 토큰
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
시계열은 순서가 정보다. 추세는 장기 변화, 계절성은 주기 반복, 자기상관은 과거와 현재 관계다. 무작위 분할은 미래 정보를 학습으로 섞을 수 있다. 텍스트는 수치화하면서 문맥 손실이 생기고, 시공간 자료는 이웃 의존성 때문에 임의 행 분할을 경계한다.
상세 이론
시계열의 색인과 분할
시계열은 값뿐 아니라 관측 시점·간격·순서가 정보다. 불규칙 간격, 누락 시점, 달력 효과를 먼저 정리한다. 미래 예측 평가에서는 과거로 학습하고 이후 구간으로 검증하며, 롤링 또는 확장 창으로 실제 운영의 재학습 과정을 모사한다.
추세·계절성·순환·불규칙
추세는 장기 수준 변화, 계절성은 고정 주기의 반복, 순환은 주기가 일정하지 않은 장기 파동, 불규칙은 나머지 변동이다. 가법 분해는 성분 크기가 수준과 무관할 때, 승법 분해는 수준이 클수록 계절 변동도 커질 때 적합하다. 분해는 설명 도구이며 미래 구조가 유지된다는 보장은 아니다.
정상성과 자기상관
약한 정상성은 평균·분산이 시간에 따라 일정하고 공분산이 시차에만 의존한다. 추세나 단위근이 있으면 차분·변환을 고려한다. ACF는 시차별 선형 관계, PACF는 중간 시차 효과를 통제한 관계로 AR·MA 차수 후보를 찾는 데 사용한다.
ARIMA의 구성
AR(p)는 과거 값, MA(q)는 과거 충격, I(d)는 d차 차분을 의미한다. ARIMA는 차분 후 정상적인 계열의 자기의존을 선형적으로 모델링한다. 차수는 ACF·PACF와 AIC/BIC, 잔차 백색잡음 진단을 함께 사용해 정하며 계절 구조는 SARIMA 항으로 확장한다.
텍스트 표현
텍스트 분석은 정규화·토큰화·불용어·형태 처리 뒤 문서를 수치 벡터로 바꾼다. Bag-of-words와 TF-IDF는 해석 가능하지만 어순·문맥을 잃고, 임베딩은 의미 유사성을 표현하지만 학습 자료의 편향을 포함할 수 있다. 사전학습 모델도 목표 도메인·언어·시점 변화에 검증해야 한다.
시공간·다변량·비정형 자료
공간 자료는 가까운 위치의 유사성, 시공간 자료는 위치와 시간 의존을 동시에 가진다. 무작위 분할은 이웃 정보 때문에 성능을 과대평가할 수 있어 공간 블록·시간 차단 검증을 쓴다. 이미지·음성·로그 같은 비정형 자료도 표현 단계와 관측 단위, 레이블 생성 과정에서 누수와 편향을 점검한다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 시계열의 색인과 분할 | 시계열은 값뿐 아니라 관측 시점·간격·순서가 정보다. | 추세·계절성·순환·불규칙 |
| 추세·계절성·순환·불규칙 | 추세는 장기 수준 변화, 계절성은 고정 주기의 반복, 순환은 주기가 일정하지 않은 장기 파동, 불규칙은 나머지 변동이다. | 정상성과 자기상관 |
| 정상성과 자기상관 | 약한 정상성은 평균·분산이 시간에 따라 일정하고 공분산이 시차에만 의존한다. | ARIMA의 구성 |
| ARIMA의 구성 | AR(p)는 과거 값, MA(q)는 과거 충격, I(d)는 d차 차분을 의미한다. | 텍스트 표현 |
| 텍스트 표현 | 텍스트 분석은 정규화·토큰화·불용어·형태 처리 뒤 문서를 수치 벡터로 바꾼다. | 시공간·다변량·비정형 자료 |
| 시공간·다변량·비정형 자료 | 공간 자료는 가까운 위치의 유사성, 시공간 자료는 위치와 시간 의존을 동시에 가진다. | 시계열의 색인과 분할 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 시간·공간 순서를 보존했는가
- 정상성·계절성·잔차를 진단했는가
- 표현 단계의 문맥 손실·편향을 확인했는가
개념 흐름

그림. 시계열은 추세·계절성·불규칙 변동으로 읽는다.
공식과 해석
ARIMA는 로 쓸 수 있다.
계산 예제
월 매출 [100,110,120]의 1차 차분은 [10,10]이다. 계절성과 이벤트는 별도로 확인한다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
import pandas as pd
from statsmodels.tsa.stattools import acf
y = pd.Series([100,103,108,114,118,121,128,132])
diff = y.diff().dropna()
print('차분:', diff.tolist())
print('ACF:', acf(diff, nlags=3, fft=False).round(3))
train, test = y.iloc[:-2], y.iloc[-2:]
print('미래 검증:', test.tolist())
# 시간 순서를 보존한다.
장 요약
- 시계열의 색인과 분할: 시계열은 값뿐 아니라 관측 시점·간격·순서가 정보다.
- 추세·계절성·순환·불규칙: 추세는 장기 수준 변화, 계절성은 고정 주기의 반복, 순환은 주기가 일정하지 않은 장기 파동, 불규칙은 나머지 변동이다.
- 정상성과 자기상관: 약한 정상성은 평균·분산이 시간에 따라 일정하고 공분산이 시차에만 의존한다.
- ARIMA의 구성: AR(p)는 과거 값, MA(q)는 과거 충격, I(d)는 d차 차분을 의미한다.
- 텍스트 표현: 텍스트 분석은 정규화·토큰화·불용어·형태 처리 뒤 문서를 수치 벡터로 바꾼다.
- 시공간·다변량·비정형 자료: 공간 자료는 가까운 위치의 유사성, 시공간 자료는 위치와 시간 의존을 동시에 가진다.