핵심
정규화(0~1)와 표준화(평균0·표준편차1)는 다릅니다. 파생변수(가공)와 요약변수(집계)도 구분하세요.
공식
결측: na.omit(행 제거), na.rm(제외 계산), 평균 대치 이상값: ESD·IQR(boxplot)로 탐지 정규화(Min-Max): 0~1 표준화(Z-score): 평균0·표준편차1 파생변수(가공·조합) vs 요약변수(합계·평균 집계) 구간화(연속→범주) vs 원핫(범주→0/1) 함정: 정규화↔표준화 범위, 파생↔요약 뒤바꿈
트리거 키워드
예시
'데이터를 0과 1 사이로 변환하는 기법은?' → Min-Max 정규화 (표준화는 평균0·표준편차1)
데이터 전처리에서 정규화(normalization)는 값을 0~1 범위로 변환(최소-최대 스케일링)하는 것이고, 표준화(standardization)는 평균 0·표준편차 1이 되도록 변환(z-점수)하는 것입니다. 또 파생변수는 기존 변수를 가공·결합해 새로 만든 변수, 요약변수는 다수 데이터를 집계한 변수입니다. ADsP에서는 정규화·표준화의 정의와 파생·요약 변수를 헷갈리게 출제합니다.
3과목 데이터 분석의 데이터 전처리 영역에서 문제 지문이나 보기에 결측값, 이상값, 정규화, 표준화, 파생변수, 요약변수, 구간화, 원핫인코딩, na.omit 같은 표현이 보이면 이 패턴을 먼저 떠올리십시오. 개념을 처음부터 따지지 않고 위 공식에 대입하는 것만으로 보기를 빠르게 좁힐 수 있습니다. 아래 관련 문항 8개가 모두 같은 방식으로 풀립니다.