3과목 데이터 분석회귀분석회귀모형 평가 3요소 + 변수선택 3법

다음은 두 독립변수로 y를 설명한 회귀분석 결과입니다. 유의수준 0.05에서 모형에서 제거를 고려해야 할 변수는?

Call:
lm(formula = y ~ x1 + x2)

Residuals:
      Min        1Q    Median        3Q       Max
  -3.8071   -2.3484    0.6049    2.1471    3.4545

Coefficients:
              Estimate Std. Error  t value Pr(>|t|)
(Intercept)    10.4215     2.4585    4.239   0.0022 **
x1              3.9581     0.2495   15.864  6.94e-8 ***
x2             -0.1768     0.3495   -0.506   0.6250  
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 2.9738 on 9 degrees of freedom
Multiple R-squared:  0.9655,	Adjusted R-squared:  0.9579
F-statistic: 126.12 on 2 and 9 DF,  p-value: 2.61e-7

핵심 개념

유의수준 0.05에서는 Pr(>|t|)이 0.05보다 큰 변수가 유의하지 않은 변수입니다.

Lasso=L1, Ridge=L2. VIF 10 이상이 문제.

평가 3요소: 1. F-통계량 p<0.05 (모형 유의성) 2. 계수 p<0.05 (계수 유의성) 3. R² (설명력) 변수선택 3법: 전진선택 · 후진제거 · 단계별 함정: Lasso=L2 (실제 L1), VIF 1 이하 (실제 10 이상)

예시: '회귀모형의 전체 유의성을 가장 먼저 확인할 지표는?' → F-통계량의 p-값

회귀모형 평가 3요소 + 변수선택 3법 패턴 전체 보기 →

해설

Pr(>|t|) 열을 보면 x2가 0.625로 0.05보다 크므로 회귀계수가 0이라는 귀무가설을 기각하지 못합니다. 따라서 ② x2가 제거 대상입니다. x1은 6.94e-8로 매우 작아 유의하고, 유의 표식도 x2에만 붙지 않습니다. 모형 전체의 F 검정 p값은 2.61e-7로 유의한데, 이처럼 모형은 유의해도 개별 변수는 유의하지 않을 수 있어 두 검정을 나누어 보아야 합니다.

같은 패턴 관련 문항