학습목표
- 회귀분석 기초의 대상·가정·산출물을 설명한다.
- 공식 또는 절차를 작은 계산 사례에 적용하고 해석한다.
- Python으로 재현 가능한 점검의 출발점을 만든다.
핵심 용어
선형회귀 linear regression · 회귀계수 · 잔차 residual · 최소제곱 · R²
한·영 정의와 약어는 통합 용어집을 함께 참조한다.
개념 설명
선형회귀는 입력 가중합으로 연속형 결과를 설명·예측한다. 다중회귀 계수는 다른 변수를 고정한다는 조건 아래의 변화다. 잔차 곡선·깔때기·영향점은 가정 문제를 시사하며 R²가 높아도 외삽·인과 설명은 보장되지 않는다.
상세 이론
회귀모형의 구성
선형회귀는 조건부 평균 E[Y|X]를 입력의 선형결합으로 표현한다. 선형이라는 말은 변수 모양보다 계수에 선형이라는 뜻이므로 x²나 로그 x를 변수로 넣어 곡선을 표현할 수 있다. 오차항은 모형이 설명하지 못한 모집단 변동이고 잔차는 적합 후 관측값과 예측값의 차이다.
최소제곱 추정
최소제곱법은 잔차제곱합 SSE를 최소화하는 계수를 찾는다. 단순회귀 기울기는 Cov(X,Y)/Var(X)로, X 변동에 비해 함께 변하는 정도를 나타낸다. 제곱은 큰 오차에 큰 벌점을 주어 계산이 편리하지만 이상치에 민감하다.
계수·절편·상호작용 해석
단순회귀 기울기는 X 한 단위 증가와 조건부 평균 Y 변화의 관계다. 다중회귀에서는 다른 입력을 고정한 조건부 관계이며 관찰자료에서 인과효과와 같지 않다. 범주 더미 계수는 기준범주와의 차이, 상호작용 계수는 한 변수의 효과가 다른 변수 수준에 따라 얼마나 달라지는지를 나타낸다.
회귀 가정
평균 구조의 선형성, 관측 독립성, 오차의 등분산성, 심각한 다중공선성 부재가 핵심이다. 정규성은 계수 검정·구간의 작은 표본 근사에 중요하지만 OLS 계수 계산 자체의 필수 조건은 아니다. 시간·군집 자료의 의존성을 무시하면 표준오차가 틀릴 수 있다.
잔차와 영향 진단
잔차-적합값 그림의 곡선은 평균 구조 누락, 깔때기는 이분산을 시사한다. Q-Q 그림은 오차 꼬리·정규 근사를, 레버리지는 입력 공간에서의 거리, Cook 거리는 관측 제거가 전체 적합에 주는 영향을 본다. 진단은 자동 삭제가 아니라 데이터 오류 확인과 대안 모형 선택의 출발점이다.
적합도와 예측 불확실성
R²는 평균만 쓰는 기준모형 대비 표본 내 제곱오차 감소 비율이며 변수를 추가하면 거의 감소하지 않는다. 수정 R², 검증 RMSE·MAE, 잔차 구조를 함께 본다. 평균반응의 신뢰구간보다 새 개인 관측의 예측구간이 오차항 변동을 추가로 포함해 더 넓다.
개념 비교표
| 개념 | 핵심 역할 | 함께 구분할 개념 |
|---|---|---|
| 회귀모형의 구성 | 선형회귀는 조건부 평균 E[Y | X]를 입력의 선형결합으로 표현한다. |
| 최소제곱 추정 | 최소제곱법은 잔차제곱합 SSE를 최소화하는 계수를 찾는다. | 계수·절편·상호작용 해석 |
| 계수·절편·상호작용 해석 | 단순회귀 기울기는 X 한 단위 증가와 조건부 평균 Y 변화의 관계다. | 회귀 가정 |
| 회귀 가정 | 평균 구조의 선형성, 관측 독립성, 오차의 등분산성, 심각한 다중공선성 부재가 핵심이다. | 잔차와 영향 진단 |
| 잔차와 영향 진단 | 잔차-적합값 그림의 곡선은 평균 구조 누락, 깔때기는 이분산을 시사한다. | 적합도와 예측 불확실성 |
| 적합도와 예측 불확실성 | R²는 평균만 쓰는 기준모형 대비 표본 내 제곱오차 감소 비율이며 변수를 추가하면 거의 감소하지 않는다. | 회귀모형의 구성 |
적용 조건과 진단
다음 조건은 공식을 대입하기 전에 확인한다. 하나라도 만족하지 않으면 결과를 버리기보다 원인을 기록하고 대안적 요약·변환·검증 설계를 선택한다.
- 평균 구조·독립·등분산을 진단했는가
- 계수를 조건부 관계로 해석했는가
- 외삽과 영향점을 확인했는가
개념 흐름

그림. 회귀선 적합도는 잔차 패턴을 확인해야 완성된다.
공식과 해석
, , 이다.
계산 예제
실제 [3,5,7], 예측 [2,5,8]이면 잔차 [1,0,-1], SSE=2, MSE=2/3이다.
Python 예제
실행 안내: 예제는 각 장의 핵심 API와 해석 순서를 보여준다. 별도 실습 환경에서 필요한 입력 데이터를 준비한 뒤 실행한다.
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_squared_error
from sklearn.datasets import make_regression
from sklearn.model_selection import train_test_split
X, y = make_regression(n_samples=300, n_features=4, noise=12, random_state=20260721)
X_train, X_valid, y_train, y_valid = train_test_split(
X, y, test_size=0.25, random_state=20260721
)
model = LinearRegression().fit(X_train, y_train)
pred = model.predict(X_valid)
residual = y_valid - pred
print('MSE:', mean_squared_error(y_valid, pred))
print('계수:', model.coef_)
print('잔차 평균:', residual.mean())
# 잔차 그림도 확인한다.
장 요약
- 회귀모형의 구성: 선형회귀는 조건부 평균 E[Y|X]를 입력의 선형결합으로 표현한다.
- 최소제곱 추정: 최소제곱법은 잔차제곱합 SSE를 최소화하는 계수를 찾는다.
- 계수·절편·상호작용 해석: 단순회귀 기울기는 X 한 단위 증가와 조건부 평균 Y 변화의 관계다.
- 회귀 가정: 평균 구조의 선형성, 관측 독립성, 오차의 등분산성, 심각한 다중공선성 부재가 핵심이다.
- 잔차와 영향 진단: 잔차-적합값 그림의 곡선은 평균 구조 누락, 깔때기는 이분산을 시사한다.
- 적합도와 예측 불확실성: R²는 평균만 쓰는 기준모형 대비 표본 내 제곱오차 감소 비율이며 변수를 추가하면 거의 감소하지 않는다.