아이티윌_데이터 분석 55기/강의내용 필기_통계 및 분석

#1 1일차_통계 기초, 표본추출, 측정과 척도, 기초 통계량, 확률분포

ecosso 2026. 4. 13. 16:20

01. 통계학 개론

 -01 통계

 -02 표본추출

 -03 측정과 척도

 -04 기초 통계량

 -05 확률과 확률분포


 

01. 통계학 개론

 -01 통계

데이터를 수집하고 정리하며 해석하는 과학적인 방법론이다.

통계학은 모집단을 연구하는 학문

모집단 표본평균
연구나 분석의 대상이 되는 전체 집합 모집단에서 일부를 선택 후 해당 집단의 특성을 추정하는 작은 집합
모수 : 모집단의 특성을 나타내는 수치_모평균(u), 모분산(s^2), 모비율(p) 통계량 : 표본의 특성을 나타내는 수치_표본평균(x), 표본분산(p^)

 

 표본분산은 s2, 시그마 x

 

● 추론 : 표본의 통계량을 사용하여 모집단의 모수를 추정하는 모든 행위 (점추정, 구간추정 등)

 => 따라서 모집단의 특성을 알기 위하여 표본을 추출한 후, 통계랑을 통해 모수를 구한다.

 

●  수치에 대한 분포를 그리기 위해서는...

이산형 : 수치지만 범주로 존재함 (방문자수 (ex_3.5명이라 할 수 없음) -> 히스토그램 

연속형 : 그 어떤 수치도 존재할 수 있음 (키, 체중) -> KDE 

 

 이산형 수치데이터를 함수로 나타내면 확률질량함수, 연속형 수치데이터를 함수로 나타내면 확률밀도함수

 

● 범주에 대한 시각화는...

막대그래프, 파이그래프


 -02 표본추출

- 단순 무작위 추출

- 계통 추출 (ex : 100번째 사람마다 추출)

- 층화 추출 (ex : 지역별 여론조사 등)

- 군집 추출 (ex : 빨간색, 검은색 공을 나누어 주고 검은색 공을 받은 그룹만 추출)

 

● 층화 추출과 군집추출의 차이 :

층화 추출과 군집추출 모두 다 그룹을 나누어 표본을 추출하지만, 군집추출은 특정 군집에서만의 표본을 추출하는 특성이 있다.

 

● 표본 오차, 표본 편의

표본 오차 비표본 오차 표본 편의(bias)
모집단을 대표할 수 있는 표본 단위들이 조사대상으로 추출되지 못하기 때문에 발생하는 오차이다. 표본 오차를 제외한 모든 오차이다. 표본추출 과정에서 발생하는 추정값의 기댓값과 모수의 차이이다.
표본의 크기가 커질수록 표본 오차는 작아지며, 전수 조사 시 표본 오차는 0이 된다. 비표본 오차는 표본의 크기에 비례하며 커진다. 조사 편의. 조사를 한 쪽 대상에만 편향하여 조사했을 시 편의가 발생한다.
원인을 제거하였을 시 확률화를 통해 최소화하거나 없앨 수 있다.

 


 -03 측정과 척도

 

●  측정과 척도

1) 질적 척도(문자)

 - 명목척도

 - 순서척도(서열척도)

2) 양적 척도(숫자)

 - 구간척도(등간척도)

 - 비율척도 : 절대적 0을 가짐 (ex : 온도가 0도라고 해서 온도가 존재하지 않는 것은 아니다. 지능이 0이라고 해서 지능이 존재하지 않는 것은 아니다.)

 

● 데이터 특성에 따른 분류 

1) 범주형(Categorica) 데이터

 - 명목형 : 순서와 상관이 없는 정성 데이터

 - 순서형 : 순서와 상관이 있는 정성 데이터

2) 수치형(Measure) 데이터

 - 이산형 : 숫자지만 허용 범위가 존재하는 데이터

 - 연속형 : 구간 내의 모든 값이 허용되는 데이터(중간값 정의 가능)


 -04 기초 통계량

 

● 통계량 : 표본에 대한 관찰값

1) 평균(Mean)

수치에 민감하다 = 이상값에 민감하다.

1,2,3,4,100이 있다면 100쪽으로 이동하게 된다.

 

2) 중앙값(Median)

중앙값은 위치 기반으로 중심을 측정하는 지표로 이상치에 대한 영향을 덜 받는다.

1,2,3,4,100이 있다면 중앙값은 3이 된다.

따라서 이상치가 있는 데이터에서 유용하게 사용된다.

 

3) 최빈값(Mode)

데이터 중 가장 빈번하게 나타나는 값으로 데이터가 짝수 개수인 경우 최빈값이 두 개 이상 나타나기도 한다. (다중 최빈값 존재 가능)

1, 2, 2, 2, 2, 4, 5 -> 2

1, 2, 2, 2, 3, 3, 3 -> 2,3

 


● 산포도(Dispersion)

범위 : 데이터 집합에서 최댓값 - 최솟값

 

● 표본분산 : 편차(평균과 떨어진 거리) 제곱의 합을 자유도(n-1)로 나눈 값

편차는 양수, 음수 둘 다 존재할 수 있기 때문에 제곱을 통해 모두 양수로 맞추어준다.

n으로 나누게 되면 수학적 분산, n-1으로 나누게 되면 통계학적 분석.

 

자유도가 n-1이 되는 이유는... 

평균이 3, 데이터가 1, 2, 3, 4, x 라면 평균이 결정된 순간 x는 절대적으로 고정된다. 

따라서 내 데이터 중에 자유롭게 변환될 수 있는 데이터의 개수는 고정된 1개의 값을 제외한 n-1개가 된다.

 => 데이터의 크기가 커질수록 n과 n-1은 근사해진다.

 => 빅데이터 기준으로 무엇으로 나누는지에 대한 차이는 작아지지만 수식상 자유도는 n-1을 사용한다.

 

● 표본표준편차

분산 혹은 편차가 커졌을 때, 연속형 변수의 분포 등에 대한 시각화가 어려워진다.

따라서 제곱근을 통해 수치를 원래 데이터의 단위로 표현한다.

 

● 사분위수 범위 (Q3 - Q1)

boxplot을 그린다고 가정하였을 때, 네모로 그려지는 부분이 IQR(사분위수 범위)이다.

50%의 데이터가 위치하는 범위를 나타낸다.

 

● 상대표준편차(변동계수-CV)   (중요)

단위가 상쇄되는 효과

서로 단위가 다른 두 집단의 산포를 비교했을 때, 단위가 큰 쪽이 단위 때문에 분산이 크게 나오는 경향이 있다.

따라서 이와 같은 경우 상대표준편차를 통해 비교해야 한다.

 

 

 => 따라서 표본표준편차를 사용해야할지, 상대표준편차를 사용해야할지 잘 생각해야 한다.


 데이터 분포

  왜도(Skewness)

 데이터 분포가 비대칭인 정도를 나타내는 수치.

 꼬리가 좌측에 있을 때(왼쪽 편포) 음의 왜도, 우측에 있을 때 양의 왜도

 

   첨도(Kurtosis)

 데이터 분포의 꼭대기(중앙)이 얼마나 높은지 나타내는 수치.

 첨도는 3을 기준으로 3보다 크면 데이터가 뾰족(밀집)하며, 작으면 꼬리가 평평한 분포를 나타낸다.

 3에 가까울수록 정규분포와 비슷하다.

 

 표준정규분포(평균분포 : 0, 표준편차 : 1) 일 경우 첨도가 3을 나타내기 때문에 3을 기준으로 정규분포 여부를 확인한다.

 때로는 3을 빼서 0과 비교하기도 한다.


 -05 확률과 확률분포

 어떤 사건이 일어날 가능성을 수치적으로 나타내는 개념으로, 0과 1 사이의 값으로 표현함.

 

확률 = 사건이 발생할 경우의 수 / 전체 경우의 수

 

 확률실험, 표본공간, 사건, 확률변수, 확률분포, 확률질량함수, 확률밀도함수 등 용어 파악 필요

 

   확률과 확률실험

1) 확률실험

 - 각 실험 반복

 - 각 반복마다 일정한 확률

 - 예상되는 결과가 정해져있지만 실제 값은 알수없음

 

2) 사건

 - 확률실험을 통해서 관심을 갖게 되는 특정 실험

 - 동전을 던져서 앞면이 나오는 사건

 

3) 확률변수

 - 사건에서 얻을 수 있는, 수치로 표현 가능한 대상

 - 사건의 결과이면서 각 결과마다의 확률값을 알 수 있음

 

 ex) 동전던지기 실험을 5번 반복해서 얻게되는 앞면이 나오는 횟수(x)

 P (x = 0) : TTTTT

               ▶ 0.5 ^ 5 = 0.03125

> 0.5 ^ 5 
[1] 0.03125

 

 P (x = 1) : HTTTT, THTTT, TTHTT, TTTHT, TTTTH

               ▶ 5 * 0.5 ^ 5 = 0.15625

               ▶ 5c1 * (0.5) ^ 1 * (0.5) ^ 4 = 0.15625

  5c1은 R에서 choose라는 함수로 계산 가능함. (5번 중 1번 성공할 수 있는 수)

> choose(5,1)*(0.5)^1*(0.5)^4
[1] 0.15625

 

P (x = 2) : HHTTT, HTHTT, ...

               ▶ choose(5,2) * (0.5) ^ 2 * (0.5) ^ 3 = 0.3125

> choose(5,2)*(0.5)^1*(0.5)^4
[1] 0.3125

 

P (x = 3) : HHHTT, HHHT, ...

               ▶ choose(5,3) * (0.5) ^ 3 * (0.5) ^ 2 = 0.3125

> choose(5,3) * (0.5) ^ 3 * (0.5) ^ 2 
[1] 0.3125

 

P (x = 4) : HHHHT, ...

               ▶ choose(5,4) * (0.5) ^ 4 * (0.5) ^ 1 = 0.15625

> choose(5,4) * (0.5) ^ 4 * (0.5) ^ 1 
[1] 0.15625

 

P (x = 5) : HHHHH

               ▶ choose(5,5) * (0.5) ^ 5 * (0.5) ^ 0 = 0.03125

> choose(5,5) * (0.5) ^ 5 * (0.5) ^ 0 
[1] 0.03125

 

 

 

  분포 시각화

 확률분포는 x가 n일 때, y(p(x))가 어떻게 되는지 보여준다.

 -> 확률변수가 가질 수 있는 값들을 x축에, y축에 대응되는 값들을 넣어 시각화한다.

 

> par(mfrow = c(1, 1))
> barplot(vx, vy)
> barplot(vy, names.arg = vx)

 

▲ 확률질량함수

 

●  확률분포의 종류 : 이산확률분포, 연속확률분포

이산확률분포(확률질량함수) 연속확률분포(확률밀도함수)
포아송분포 정규분포
베르누이분포 표준정규분포
이항분포(성공횟수 : 자유투 성공률 등) t분포
초기하분포 카이제곱분포
기하분포 F분포
음이항분포  
다항분포  

 

 

 

모평균을 표본평균으로부터 얻기 위해서 어느 쪽이 더 큰지, 작은지 확인할 때 사용하는 것이 t분포.

 

 => 모평균과 관련된 분포는 정규분포, t분포.

 

카이제곱분포

분산과 관련된 분포이다. 표본분산이 가지는 분포가 카이제곱이며, 분산추정을 할 때 가정하는 분포가 카이제곱분포이다.

하나의 집단에서의 분포를 확인할 때 사용한다.

 

F분포

두 집단의 분산이 같은지 아닌지에 대한 확인을 할 때 사용하는 분포이다.

 

모수 - 통계량과 대응되는 모집단의 특성

        - 확률 분포에서의 분포 특성 (확률분포를 다르게 결정짓는 요인)

 

● 베르누이 분포

 성공 혹은 실패로만 구성되어 있으며, 단 1번만 실행하는 경우에 한정한다.

 성공 혹은 실패로만 구성되어 있는 실험을 베르누이 실험이라한다.

 

E(X) = p

Var(X) = p(1-p)

 

●  이항분포

 - 이산형 확률분포

 - 베르누이 시험을 n0회 반복했을 때 성공횟수(X)가 따르는 분포

 - 모수 : n(시행 횟수), p(성공 확률)

 - X ~ B (n,p)

 

E(X) = np

Var(X) = np(1-p)

 

[이항분포 예제]

자유투 성공률이 0.8인 선수가 경기에 나갔을 때, 자유투 성공을 하기까지 몇 번(x)의 시도를 해야하는가 : 시도횟수가 확률변수

베르누이분포는 단 1회 시도했을 때의 성공률을 말한다. 이 베르누이분포가 n회 누적되었을 때가 이항분포.

 

그러나 이항분포가 지속적으로 반복되는 경우 정규분포의 형태를 가지게 된다.

 

 * in R) 자유투 성공률이 0.8인 a선수가 총 10번 자유투를 던졌을 때 4번 성공할 확률은?
            확률변수 (x) : 총 10번 자유투 성공횟수

x ~ b(10, 0.8)
P(X=x) = nCx * p^x * (1-p)^n-x
P(X=4) = 10C4 * 0.8^4 *(0.2)^6

> choose(10,4) * 0.8^0.4 * (0.2)^6
[1] 0.01229236

 

 

 # R에서 사용 가능한 확률 함수

 

1. 확률질량/밀도 함수 : dbinom()  [ 이항분포일 때 dbinom, 정규분포일 때 dnom, t분포일 때 dtnom ... ]

dbinom(x,      # 성공횟수
            size,  # 시행횟수
            prob) # 성공확률

* 이항분포 시각화
1) n의 변화에 따른

> v1 <- rbinom(100, 10, 0.5)
> v2 <- rbinom(100, 20, 0.5)
> v3 <- rbinom(100, 30, 0.5)
> par(mfrow=c(1,3))
> par('mar' = c(5,5,4,2))
> hist(v1, breaks = 0:30)
> hist(v2, breaks = 0:30)
> hist(v3, breaks = 0:30)

 


2) p의 변화에 따른

> v1 <- rbinom(100, 10, 0.1)
> v2 <- rbinom(100, 10, 0.5)
> v3 <- rbinom(100, 10, 0.9)
> par(mfrow=c(1,3))
> par('mar' = c(5,5,4,2))
> hist(v1, breaks = 0:10, prob = T)
> hist(v2, breaks = 0:10, prob = T)
> hist(v3, breaks = 0:10, prob = T)

2. 누적분포함수 : p____

 

3. 퍼센트포인트함수 : q____

 

4. 랜덤샘플링 : r____