2026/06 11

중간 프로젝트 배경 및 개요 설정

주제 : 서울시 이륜차 교통사고 핫스팟 분석 및 공간적 특성 분석 01 프로젝트 배경 최근 국내 교통안전 정책은 교통사고 다발지역을 중심으로 위험 요인을 파악하고 개선하는 방향으로 추진되고 있다. 대표적으로 제9차 국가교통안전기본계획, 제7차 교통사고 잦은 곳 개선사업 등을 통해 사고다발지역에 대한 관리와 개선이 이루어지고 있다. 그러나 관련 정책과 지침을 검토한 결과, 교통사고원인조사지침, 한국도로교통공단의 TAAS(Traffic Accident Analysis System), 경찰청의 TMACS(Traffic Management Analysis System) 등 각 기관에서 사고다발지역을 관리하고 있음에도 불구하고 사고다발지역에 대한 통일된 법적 정의나 법제화된 기준은 존재하지 않는 것으로 확인되..

중간 프로젝트 2026.06.22

#12 12일차_군집분석, 연관분석

01 군집분석 -01 특징 -02 종류 -03 평가척도 02 연관분석 실루엣 계수는 군집이 잘 묶였나, 그렇지 않은가를 보여줄 뿐이지 정말로 군집 내의 특성을 명확하게 반영하였는지를 확인하기 위해서는 다른 검증을 사용해야 한다.군집분석의 평가척도는 비즈니스적으로 A,B,C...의 성격을 가진다까지는 말해주지 않는다.따라서 각 군집의 특성을 들여다보았을 때, 01 군집분석 -01 특징 - 비지도 학습 - 거리를 기반으로 유사한 데이터끼리 하나의 군집을 형성하여 데이터를 여러 군집으로 나누는 과정 -> 세그먼트 이해 (변수 선택, 통계적 검증 (군집 이질성 -> f검정, 실루엣 계수 등), 비즈니스적 검증 -> 수치 비교) - 이상치에 민감 - 스케일에 민감 -02 종류 1) 계층적 군집분석 - 한 ..

#10 회귀모형과 패널티 모형, 부스팅 이론

01 회귀 적합 과제-01 선형 회귀 -02 기타 회귀 02 선형회귀 모형의 패널티 모형 -01 릿지 -02 라쏘 -03 엘라스틱넷 03 타겟변수 변환에 따른 회귀분석 성능 비교 04 부스팅 이론01 회귀 적합 과제 -01 선형 회귀 > 변수 선택 중요 > 종속변수 분포에 따라 변수 변환 필수 > 이상치 민감 > 모형 가정 확인 필수 > 유의성 검정 결과 확인 가능 (여러 변수가 같이 학습될 때 각 회귀계수의 유의성 정도) -02 기타 회귀 > 모델에 따라 변수 선택이 불필요할 수 있음 (트리기반) > 대체로 종속변수 분포에 따라 변환 필수 (트리기반은 효과가 거의 없음) > 모델에 따라 이상치 민감 여부 다름 > 통계적 모형 가정 불필요 > 유의성 검정 결과 확인 불가02 선형회귀 모형의 패널티 모형 ..

#8 클래스 불균등 처리

01 클래스 불균등 처리 -01 언더샘플링 -02 오버샘플링 -03 가중치 조절 -04 임계값 이동01 클래스 불균등 처리 -01 언더샘플링 1) RandomUnderSampler - 다수 클래스 데이터를 랜덤하게 선택하여 제거 - 다수 : 소수 비율이 정확히 1 : 1이 됨 - 중요한 데이터의 손실 발생 위험이 존재 (가장 위험한 방법) 2) CondensedNearestNeighbour - 뭉쳐져있는 다수 클래스를 중복으로 가정하고 제거 -> 결정결계와 먼 다수클래스를 제거 - 다수 클래스 데이터에서 랜덤하게 데이터를 선택하며, k개의 가장 가까운 이웃을 확인 후, 그 이웃이 다수클래스 (같은편)이면 제거 3) EditedNearestNeighbours - 결정경계 근처에 있는 다수클래스 일부를 ..

#7 7일차_독립성 검정, 적합도 검정, 클래스 불균등 처리

01 독립성 검정02 적합도 검정03 클래스 불균등 처리 -01 언더샘플링 -02 오버샘플링 -03 가중치 조절 -04 임계값 이동01 독립성 검정 - 범주형 자료 분석의 일종 (빈도분석 = 교차분석 = 카이제곱 검정) - 멘델의 유전자 법칙은 적합도 검정~ - 두 범주형 자료가 독립적인지에 대한 여부를 확인하는 검정 형태 ex) 성별별 통신사 선호도가 존재하는지에 대한 여부, 타이타닉 데이터에서 성별별 생존 여부가 다른지에 대한 가설검정 등 - 가설의 형태 H0 : 두 변수가 서로 독립적이다. (연관성이 없다) H1 : 두 변수는 서로 독립적이지 않다. (연관성이 있다) - 카이제곱 통계량이 클수록 (유의확률이 작을수록) 두 변수의 연관성 강도가 커진다. ( ★ ★ ★ )유의성 정도는 검정통..

#6 교호작용 및 효과 검증

[ 과제5. 교호작용 효과 검증 ]# 1. 데이터 로딩 및 설명import pandas as pdpd.set_option('display.max_column', None)df = pd.read_csv('telecom_churn.csv') # X, y 분리 / 노이즈 변수 제거X = df.drop(columns=['churn','phone number'])y = df['churn']# 변수 추가X['total minutes'] = X.loc[:, X.columns.str.contains('minutes')].sum(axis=1) # 총 통화시간X['total calls'] = X.loc[:, X.columns.str.contains('calls')].sum(axis=1) # 총 통화건수X['..

#5 5일차_데이터 분석 과정, 로지스틱 회귀, 교호작용

01 데이터 분석 과정 -01 예측 모델링 과정 (회귀, 분류) -02 EDA -03 전처리 -04 모델링 02 로지스틱 회귀 -01 분류 모델 -02 장점 -03 단점 -04 로지스틱 회귀 모형 (**) 03 교호작용 (상호작용 : Interaction) 효과01 데이터 분석 과정 -01 예측 모델링 과정 (회귀, 분류)- 분석기획 (목적설정) -> 데이터 수집 -> EDA -> 전처리 -> 모델링 -> 평가 -> 전재 -02 EDA (데이터 탐색) - 노이즈 확인 (결측치, 이상치)수치형문자형히스토그램box plot (이상치 탐색)빈도수최빈값 - 각 변수의 분포 확인 : 정규성 검정, 정규화를 통해 정규분포로 만드는 로그변환 등 - 각 변수의 타입 확인 (수치형, 범주형 -> 인코딩 필요) >..

#4 4일차_복사 / SVM·RF 실습 / 모델링 파이프 라인 구축 / 분류 모델 / knn

01 얕은 복사 / 깊은 복사02 SVM / RF 비교 실습03 모델링 파이프 라인 구축04 분류 모델05 knn (K nearest neighbors)01 얕은 복사 / 깊은 복사import pandas as pd df1 = pd.DataFrame({'A':[1,2], 'B':[10,20]}) df2 = df1 # 복사 df3 = df1.copy # 복사 df1.iloc[0,0] = 100 # 원본 수정 발생 df2 # 카피본도 수정 발생 (메모리 절감 시 사용) df3 # 원본과 무관함 (수정 사항 반영x, 정말 원본이 변경되면 안될 때 사용)df2Out[7]: A B0 100 101 2 20df3Out[8]: id(df1) # 주소값 i..

#3 3일차_SVL 실습, 독립변수 스케일링 + 연습문제 및 문제풀이

01 SVL 실습 -01 실습1 -02 결과 시각화 : 히트맵 -03 그리드 서치 -04 실습2 (cancer의 종양의 양성 / 악성 분류 (SVC)) 02 독립변수 스케일링 -01 방법 -02 코드구현 -03 주의사항 -04 올바른 스케일링 / 잘못된 스케일링 비교 03 'telecom_churn.csv' 실습 -01 인코딩 -02 실습01 SVL 실습 -01 실습1 [ 예제 - SVM을 사용한 iris 품종 최적 분류 ] # step1) 데이터 로딩 from sklearn.datasets import load_iris iris = load_iris() X = iris['data'] y = iris['target']# step2) 데이터 분리 from sklearn.model_selection imp..

#2 2일차_랜덤포레스트 (분류), SVM (Support Vector Machine)

01 랜덤포레스트 (분류) -01 트리의 성장 -02 랜덤포레스트의 장단점 -03 분석코드 02 SVM (Support Vector Machine)01 랜덤포레스트 (분류) - 앙상블 모형 : 동일하거나 다른 모델을 결합하여 하나의 의사결정을 하도록 만드는 과정이다. - 여러 개의 의사결정나무를 결합한 앙상블 모형이다. - 목적은 서로 다른 트리를 구성함으로써 : 1) 부트스트랩 : 복원추출을 허용하여 크기는 같지만 구성이 다른 샘플을 만드는 과정 2) 임의성정도 (max_features) : 가지 성장 시 (split) 일부 독립변수만 고려하여 자식노드로 분할 3) 배깅 (bootstrap + aggregating) : 각 트리의 학습 결과를 최종 결합 (다수결, 평균)하여 하나의 결과를 만드는..