* 통계학 / 표본추출방법
01. 이산확률분포
-01 베르누이 분포
-02 이항 분포
-03 포아송 분포
-04 기하 분포
02. 중심극한정리
03. 모평균 추정
04. 가설검정
-01 가설
-02 오류의 종류
-03 가설 검정 방식
-04 가설 검정 종류
* 통계학 / 표본추출방법
통계학 : 데이터를 기반으로 하여 현상을 확인/연구/검정하는 학문
1) 기술통계학 : 자료를 하나의 수치로 요약
- 중심성 : 평균, 중앙값, 최빈값
- 산포도 : 분산, 표준편차, 범위, 사분위수범위, 변동계수
- 분포도 : 왜도, 첨도
2) 추측통계학(추론)
2-1) 추정 : 모수를 특정 수치로 예측
- 점추정
- 구간추정 : 오차비율 설정(=유의수준(5%)) -> 신뢰수준(1-유의수준) 설정 후 모수에 대한 확률적 구간 추정
2-2) 가설검정
- 모수에 대한 가설을 세우고 통계적으로 해당 가설 유의성 판단 행위
표본추출방법
1) 랜덤샘플링
규칙없이 랜덤하게 추출
2) 층화 추출
모집단을 여러 하위 계층으로 나누고 각 계층마다 샘플링
예) 우리나라 전체 국민의 소득 평균이 궁금하다면?
소득이 지역별 차이가 있음 -> 각 지역별로 지역의 크기만큼 추출
서울:100, 경기:90, 인천:80, 강원:70, 충청:80 ,....
3) 군집 추출
모집단을 여러 하위 군집으로 나눠서 그 중 일부 군집만 선택
예) 학생들에게 3개 색의 공 나눠주고 그 중 빨간공을 가진 집단 선택
4) 계통 추출
일정한 간격을 두고 샘플링을 진행
예) 출구조사시 투표소를 나오는 사람 기준으로 5번째 해당되는 사람 선택
# [ 변수 스케일링 ]
변수의 단위가 서로 다를때 같은 단위로 맞추는 작업
1) 표준화
- 평균:0, 표준편차:1로 만드는 작업
- 공식 : (X - 평균)/표준편차
2) 정규화
- 최소:0, 최대:1
- 공식 : (X - 최소)/(최대-최소)
예) 변환전 : 1 2 3 4 5
변환후 : 0 0.25 0.5 0.75 1
예제) boston.csv 파일을 읽고
boston <- read.csv('boston.csv')
1) black 변수 표준화
v1 <- (boston$black - mean(boston$black))/sd(boston$black)
round(mean(v1),7) # 0
sd(v1) # 1
2) age 변수 정규화
v2 <- (boston$age - min(boston$age)) / (max(boston$age) - min(boston$age))
min(v2) # 0
max(v2) # 1
01. 이산확률분포
-01 베르누이 분포
확률변수 X가 성공 혹은 실패로 표본공간이 이루어진 경우의 분포
-02 이항 분포
성공 확률이 p로 동일한 베르누이 시행을 n번 반복해서 실험하는 경우 성공 횟수가 따르는 분포
ex) 동전 던지기, 출루횟수, 자유투 횟수
-03 포아송 분포
이산형 확률 분포 중 주어진 시간, 영역 등에서 어떤 사건이 발생할 횟수를 나타내는 확률분포
ex) 서서울 톨게이트(영역)를 하루(시간)에 통과하는 차량의 수
포아송 분포는 람다가 모수 : X ~ Pois(λ)
-04 기하 분포
기하 분포 : 성공확률이 p인 베르누이 시행을 첫 번째 성공할 때까지 반복 시행할 때 그 횟수(X)가 따르는 분포
* 기하 분포와 이항 분포의 차이
| 이항 분포 | 자유투게임을 할 시 횟수가 정해져 있고, 몇 번을 성공하는지에 대한 정의 |
| 기하 분포 | 자유투게임을 할 시 확률이 정해져 있고, 성공할 때까지 몇 번을 시공해야하는지에 대한 정의 |
02. 중심극한정리
표본론 : 모집단을 어떻게 샘플링해야지 모집단을 설명할 수 있는 표본집단이 될지에 대한 학문
중심극한정리는 표본이 적절하게 추출되었다는 조건 하에, 표본평균의 분포가 정규분포에 근사함을 보장하며 이를 통해 모평균을 추정할 수 있게 한다.
> 확률을 알려면 분포를 알아야 하는데, 모집단의 모평균과 분포는 파악하기 어렵다.
> 따라서 표본집단의 통계량을 통해 모집단의 특성을 추정하게 되는데, 내가 구하고자하는 모평균과 표본평균이 통계학적으로 어느 정도의 오차율을 가지고 있는지, 어느 정도의 신뢰도를 가지고 있는지를 확인하기 위하여 신뢰구간을 추출한다.
> 그렇기에 모집단의 평균을 추정하기 위해서는 개별 표본값의 분포보다는 표본평균의 분포가 중요하다. (2일차 문제풀이 참고)
> 중심극한정리에 따르면 표본을 여러 번 반복 추출했을 때 표본평균의 분포는 정규분포에 근사하게 되며, 이를 통해 신뢰구간을 설정할 수 있다.
> 다만 실제로 표본을 여러 번 추출하기 어렵기 때문에, 이러한 이론적 성질을 바탕으로 단일 표본에서도 추론을 수행한다.
> 또한 표본이 많아질수록 평균의 흔들림(분산)이 줄어들어 모평균에 더 가까워진다.
> 큰 수의 법칙 : 따라서 데이터를 많이 뽑을수록, 표본의 크기가 커질수록 표본평균의 분산은 0에 가까워진다.
* 표본평균의 분산은 모분산의 영향을 받으며, 이는 표본 크기에 반비례하여 감소한다.
* 따라서 모평균에 대한 신뢰구간을 구할 때에도 이 분산이 중요한 역할을 한다. 그러나 실제로는 모분산을
알 수 없는 경우가 대부분이므로, 표본분산을 이용하여 이를 추정해야 한다.
* 이때 모분산을 알고 있다는 가정 하에서는 정규분포를 기반으로 한 z-검정을 사용할 수 있지만, 모분산을 모르는
일반적인 상황에서는 t-분포를 이용한 t-검정을 사용하여 신뢰구간을 추정한다.
03. 모평균 추정
표본평균이 정규분포를 따른다 <--- 중심극한 정리
xbar ~ N(μ, σ² / n)
-01 점추정
xbar -----> μ 추정
E(xbar) = μ
* 큰 수의 법칙에 의하면 샘플크기(n)가 커질수록 표본평균의 분산이 0에 가까워진다.
따라서 큰 샘플의 경우 표본평균이 확률적으로 모평균에 근사해진다.
-02 구간추정
90% 신뢰구간 : [xbar - 1.64 * (σ / sqrt(n)) , xbar + 1.64 * (σ / sqrt(n))]
in R ) qnorm(0.01/2)
> qnorm(0.1/2)
[1] -1.644854
95% 신뢰구간 : [xbar - 1.96 * (σ / sqrt(n)) , xbar + 1.96 * (σ / sqrt(n))]
99% 신뢰구간 : [xbar - 2.58 * (σ / sqrt(n)) , xbar + 2.58 * (σ / sqrt(n))]
04. 가설검정
-01 가설
1) 귀무가설 (H0) (영가설) :
- 기존과 동일하다는 가정
- 검정통계량 계산 시 귀무가설이 참이라는 가정을 하고 가설검정을 하기 때문에 귀무가설은 반드시 '='를 포함되는 형태
2) 대립가설 (H1) (대안가설) :
- 연구자가 밝히려는 사실
ex) A 회사에서 개발한 신엔진이 기존 연비보다 좋아졌는지를 가설검증 (기존연비 12.5)
H0 : μ >= 12.5 (μ = 12.5)
H1 : μ < 12.5
ex) A 회사에서 개발한 다이어트약이 효과가 있는지 가설검정 (μ : 복용 전 체중 - 복용 후 체중)
H0 : 복용 전 체중 - 복용 후 체중 <= 0
H1 : 복용 전 체중 - 복용 후 체중 > 0
-02 오류의 종류
| 귀무가설 참 | 귀무가설 거짓 | |
| 귀무가설 채택 | O | X (제 2종 오류) 제 2종 오류를 발생시킬 확률은 β |
| 귀무가설 기각 | X (제 1종 오류) 제 1종 오류를 발생시킬 확률은 α |
O |
-03 가설 검정 방식
1) 검정통계량 : 영가설의 채택 및 기각 여부를 확인하기 위해 표본을 통해 관찰된 값을 사용하는 통계량
귀무가설(영가설)이 참이라는 가정 하에 얻어진 통계량이 채택역(해당 통계량을 신뢰할 수 있는 영역) 구간에 있는지에 따라 귀무가설의 기각여부를 결정하는 방식
| 채택역 | 영가설을 채택할 수 있는 영역 (z범위) |
| 기각역 | 영가설을 기각할 수 있는 영역 (z범위) |
따라서 검정통계량을 통해 영가설을 채택하느냐, 기각하느냐가 결정된다.
ex) 초콜릿의 무게가 200일 때, 해당 무게는 기준치에 부합하는지 여부 가설검정
H0 : μ = 200
H1 : μ != 200
> 검정통계량 계산
Z = (xbar - μ) / (σ/sqrt(n))
Z* = (xbar - 200) / (σ/sqrt(n))
채택역 : [ -1.96, 1.96 ]
기각역: [ -inf , -1.96 ] 또는 [ 1.96 , inf ]
> (199.46 - 200) / (5/sqrt(50))
[1] -0.7636753
채택역 구간 내의 통계량이 나오므로 영가설( H0 : μ = 200 )을 채택한다.
2) 신뢰구간
ex) 초콜릿의 무게가 200일 때, 해당 무게는 기준치에 부합하는지 여부 가설검정
H0 : μ = 200
H1 : μ != 200
초콜릿 무게에 대한 95% 신뢰수준 : [198.88, 200.5]
=> H0이 채택된다.
# [ 연습문제 1 ]
# A사의 건전지 기대 수명이 100시간이라고 한다.
# A사의 건전지가 실제 기대수명에 충족하는지 확인하고자
# 80개의 건전지를 임의 추출한 결과 98이었을 때,
# A사의 건전지가 실제 기대수명에 충족하는지 여부를 유의수준 1%로 가설검정하여라.
# (단, 모표준편차는 30이라 가정)
H0 : μ = 100
H1 : μ ! = 100
# 채택역 구하기
-2.58 ~ 2.58
# 검정통계량 구하기
Z* = (98 - 100) / (30/sqrt(80)) # -0.5962848
> (98 - 100) / (30/sqrt(80))
[1] -0.5962848
채택역 구간 내 통계량이 나오므로 귀무가설을 채택한다.
[ 문제풀이 ]
# 1) 검정통계량 방식
H0 : μ = 100
H1 : μ ! = 100
xbar <- 98
n <- 80
σ <- 30
α <- 0.01
# 채택역 구하기 [-2.575829, 2.575829]
ld <- qnorm(α/2, mean = 0, sd = 1)
lu <- qnorm(1-α/2, mean = 0, sd =1)
> ld <- qnorm(α/2, mean = 0, sd = 1)
> ld
[1] -2.575829
> lu <- qnorm(1-α/2, mean = 0, sd =1)
> lu
[1] 2.575829
Z* = (xbar - 100) / (σ/sqrt(n))
=> 귀무가설이 검정통계량의 채택역 구간 안에 있으므로 귀무가설 채택!
# 2) 모평균 신뢰구간
c(xbar - 2.575829 * (σ/sqrt(n)), xbar + 2.575829 * (σ/sqrt(n))) #89.36041 106.63959
> c(xbar - 2.575829 * (σ/sqrt(n)), xbar + 2.575829 * (σ/sqrt(n)))
[1] 89.36041 106.63959
=> 귀무가설의 모평균 가정값이 모평균의 99% 신뢰구간에 있으므로 귀무가설 채택!
-04 가설 검정 종류
1) 양쪽검정
H0 : μ = 100
H1 : μ != 100
qnorm(0.05/2, mean = 0, sd = 1)
qnorm(1-0.05/2, mean = 0, sd = 1)
> qnorm(0.05/2, mean = 0, sd = 1)
[1] -1.959964
> qnorm(1-0.05/2, mean = 0, sd = 1)
[1] 1.959964
2) 한쪽검정
2-1) 왼쪽검정
H0 : μ = 100
H1 : μ < 100
qnorm(0.05, mean = 0, sd = 1)
> qnorm(0.05, mean = 0, sd = 1)
[1] -1.644854
2-2) 오른쪽검정
H0 : μ = 100
H1 : μ > 100
qnorm(1-0.05, mean = 0, sd = 1)
> qnorm(1-0.05, mean = 0, sd = 1)
[1] 1.644854
# 가설 검정 기각역 시각화

# [ 연습문제 2 ]
# A 자동차사의 엔진의 기존 연비는 평균 12.5(km/l), 표준편차 0.5(km/l)로 알려져 있는데,
# 새로 개발한 엔진이 기존 연비보다 개선되었음을 가설 검정
# 총 40대의 자동차 연비를 측정한 결과 평균이 12.64(km/l)
H0 : μ = 12.5
H1 : μ > 12.5 (오른쪽검정)
xbar = 12.64
μ = 12.5
σ = 0.5
n = 40
# 검정통계량에 의한 가설검정
- 검정통계량 기각역 : [1.645, inf]
- 검정통계량 채택역 : [-inf, 1.645]
Z* = (12.64 - 12.5) / (0.5/sqrt(40))
> (12.64 - 12.5) / (0.5/sqrt(40))
[1] 1.770875
검정통계량이 기각역 구간 내에 존재하므로 귀무가설이 기각된다.
=> A회사의 새로 개발한 엔진의 연비는 기존 연비보다 개선되었다고 말할 수 있다. (대립가설 채택 : H1 : μ > 12.5 (오른쪽검정))
'아이티윌_데이터 분석 55기 > 강의내용 필기_통계 및 분석' 카테고리의 다른 글
| #5 5일차_모집단의 가설검정, 두 집단의 모평균 차이 가설검정 (0) | 2026.04.17 |
|---|---|
| #4 4일차_가설검정, t-분포 (0) | 2026.04.16 |
| #2 2일차_추론, 확률분포, 정규분포, 표준정규분포, 중심극한정리 (0) | 2026.04.14 |
| #1 1일차_통계 기초, 표본추출, 측정과 척도, 기초 통계량, 확률분포 (0) | 2026.04.13 |
| #10 10일차_ggplot2 (0) | 2026.04.13 |