2026/04 37

#14 14일차_회귀분석, 변수 선택 및 제거

01 회귀분석 -01 회귀분석 모형 종류 -02 회귀모형의 가정 -03 모형 평가 02 단순 선형 회귀분석 -01 회귀계수의 추정 -02 모형 평가 -03 모형의 설명력 03 다중 선형 회귀분석 -01 다중 선형 회귀분석이란 -02 다중공선성 04 변수 선택 / 변수 제거 -01 의미 -02 의의 -03 방법 -04 예제01 회귀분석 -01 회귀분석 모형 종류1) 단순 선형 회귀 하나의 종속변수를 하나의 1차 설명변수로 해석하는 모형2) 다중 회귀 하나의 종속변수를 둘 이상의 1차 설명변수로 해석하는 모형3) 다항 회귀 하나의 종속변수를 하나 이상의 1차 이상 설명변수로 해석하는 모형(비선형 모형) lm(formula, # y ~ x data) # 데이터 이름* 모든 회귀는 lm으로 ..

#13-2. 13일차 퀴즈에 대한 문제풀이

[ 연습문제 - 군집분석 ] cancer.csv 파일의 설명변수(id제외)만 사용하여 계층/비계층 군집분석을 진행 단, 변수 스케일링 후 군집분석을 진행하세요 더보기[ 내 답변 ] df df$id head(df)str(df)# 변수 스케일링f1 (x - mean(x)) / sd(x)}df[,-1] head(df)# 계층적 군집분석# 거리행렬 구하기x d1 # 학습m1m2m3m4m5m6# 시각화dev.new()par(mfrow=c(2,3))# 최단거리법plot(m1, hang = -1, main = 'Single')# 최장거리법plot(m2, hang = -1, main = 'Complete')# 중심연결법plot(m3, hang = -1, main = 'Centroid')# 평균연결법plot(m4, ..

#13 13일차_군집분석 및 평가 ·해석, 변수 스케일링, 회귀분석

01 계층적 군집분석 -01 계층적 군집분석이란 -02 군집 간 거리 -03 실습 02 비계층적 군집분석 -01 비계층적 군집분석이란 -02 k-means 군집 형성 방법 -03 k-means와 k-means ++ -04 실습 03 변수 스케일링 -01 표준화 (Standard scale) -02 정규화 (Minmax scale) -03 robust scale 04 혼합 분포 군집 -01 혼합 분포 군집이란 -02 EM 알고리즘 05 DBSCAN 06 SOM -01 SOM이란 -02 SOM의 구조 07 군집 분석 평가 및 해석 08 회귀분석* 이해를 위해 첨부된 일부 이미지는 chatGPT를 이용해 제작하였음 01 계층적 군집분석 -01 계층적 군집분석이란 계층적 군집분석은 비지도학습의 일종이다. 모..

#11-2. 11일차 퀴즈에 대한 문제풀이

# [ cancer 데이터를 사용하여 암 종양의 악성 여부 분류 ]1. DT, RF 모형에 대한 정확도 확인2. 변수 중요도를 기반으로 상위 2개, 하위 2개를 선택하여 교차산점도 출력 (종속변수 색으로 구분)3. 위 결과 생성4. RF 모형의 매개변수 튜닝 결과 해석 cancer # Python에서는 관계없으나 R에서 랜덤포레스트를 진행할 시 y축이 factor로 선언되어야 한다. cancer$diagnosis head(cancer)summary(cancer[,-1])> summary(cancer[,-1]) diagnosis radius_mean texture_mean perimeter_mean area_mean smoothness_mean co..

#11 11일차_분석 과정, 앙상블 모형, 랜덤포레스트

01 분석 과정 -01 모델링 -02 의사결정나무 ( #10 10일차_분류분석)02 앙상블 모형 03 랜덤포레스트 01 분석 과정분석기획 → 데이터 수집 → 데이터 처리 → 모델링 → 평가 → 튜닝 → 전개 - 데이터 수집의 경우회사의 경우 업무 목적에 따라 DB가 세팅되어 있다 (데이터 마트).분석용 서버를 구축해야할 때, 기존 DB에서 새 DB로 데이터를 이동시키는 것을 Data migration이라고 한다.이 때 ETL, API 등을 통해 내부 데이터를 분석용 DB에 적재하게 된다.외부 데이터를 가져와야하는 경우 크롤링 등의 다양한 방법이 존재한다. - 데이터 처리EDA(분포시각화, 기술통계량확인, 노이즈확인)결측치 처리이상치 처리변수 변환(스케일링, 파생변수생성, 단순변환(지수, 역수..

#10 10일차_분류분석

01 분류분석 (Classification) 01 분류분석 (Classification)y가 수치형인지, 범주형인지에 따라 분석방법이 달라진다.y가 수치형인 경우 회귀분석, 범주형인 경우 분류분석을 수행한다. [ 의사결정나무 ] - 단 한 개의 트리 구조를 사용하여 Y를 분류하는 모델링 기법 - 비통계 모델(통계적 가정이 필요 없음) 장점) - 간편, 쉽고 빠름 -> 해석이 용이 - 과적합이 되기 쉬움 단점) - 과적합 되기 쉬움 - 평가척도를 통게적, 확률적으로 해석 불가 학습과정) 1. 성장 - 불순도 감소량을 기준으로 최족의 분리 기준을 찾아서 가지를 형성함 - 리프노드로 갈수록 불순도가 낮아지도록 성장 2. 정지규칙 - 더 이상 분할을 하지 않는 규칙(현재 노드가 마지막 노드가 되도록 하는 기준..

#9 9일차_교차분석, 변수 선택

01 교차분석 -01 적합도 검정 -02 독립성 검정 02 변수 선택 -01 분석 -02 상관관계 분석 -03 카이제곱 통계량 -04 t.test -05 변수선택 방법01 교차분석 - 범주형 자료들의 교차빈도를 기반으로 분석하는 기법 - 카이제곱 검정 (모분산 검정시에도 쓰이나, 실무적으로는 교차분석에 가장 많이 사용한다.) - 적합도 검정, 독립성 검정(동질성 검정) -01 적합도 검정 - 기대분포와 표본분포가 일치하는가? - 표본분포가 알려진 기대분포와 일치하는지를 검정 가설) H0 : 표본분포가 기대분포와 일치한다. H1 : 표본분포가 기대분포와 일치하지 않는다. 검정통계량) 카이제곱 통계량 = Σ((기대도수 - 실제도수)² / 기대도수) ~ Chisq(k-1) (k-1)에서의 카이제곱 분포에서..

#8 8일차_가설검정 절차, 문제풀이

01 가설검정 절차 02 문제풀이 -01 문제1 -02 문제2 -03 문제3 -04 문제4 -05 문제5 -06 문제601 가설검정 절차 1. 모수 2. 검정통계량 3. 가설형태 4. 검정통계량의 기각역/채택역 5. 유의확률 6. 함수02 문제풀이 -01 문제1# 프로세스에서 10개의 제품을 랜덤 샘플링하여 검사한 결과 2개의 불량품이 # 발견되었다. 공정 불량률이 0.1보다 크다고 할 수 있는지 # 유의수준 10%에서 검정하시오.더보기[ 내 답변 ] # 가설# H0 : p = 0.1# H1 : p > 0.1 (오른쪽검정)# 모비율 단일 집단 비교phat p0 n # 검정통계량(phat - p0) / sqrt(p0*(1-p0)/n) # 1.054093# 가설형태 및 기각역/ 채택역# 오른쪽검정# 유의수준..

#7-2. 7일차 퀴즈에 대한 문제풀이

# [ 연습 문제 ]# 화학공정 온도 100, 150, 200, 250도 4개의 수준에서 랜덤하게 반복 실험하여 # 수율(양품비율)을 측정, 각 온도별로 수율값이 달라지는지# (온도의 변화가 수율에 영향을 미치는지 검정)# 관찰대상 : 각 온도별 양품수 a100 a150 a200 a250 # 가설# 영가설) 세집단의 모평균이 같다(온도의 변화가 수율에 영향을 미치지 않는다)# 대립가설) 세집단의 모평균이 다르다(온도의 변화가 수율에 영향을 미친다)더보기[ 내 답변 ] # SST = SSE + SStdf1 # se100 se150 se200 se250 n k n100 n150 n200 n250 # MSEsse mse # SStst100 st150 st200 st250 sst mst # F 통계량mst /..