01. 통계학 개론
-01 통계
-02 표본추출
-03 측정과 척도
-04 기초 통계량
-05 확률과 확률분포
01. 통계학 개론
-01 통계
데이터를 수집하고 정리하며 해석하는 과학적인 방법론이다.
통계학은 모집단을 연구하는 학문
| 모집단 | 표본평균 |
| 연구나 분석의 대상이 되는 전체 집합 | 모집단에서 일부를 선택 후 해당 집단의 특성을 추정하는 작은 집합 |
| 모수 : 모집단의 특성을 나타내는 수치_모평균(u), 모분산(s^2), 모비율(p) | 통계량 : 표본의 특성을 나타내는 수치_표본평균(x), 표본분산(p^) |
표본분산은 s2, 시그마 x
● 추론 : 표본의 통계량을 사용하여 모집단의 모수를 추정하는 모든 행위 (점추정, 구간추정 등)
=> 따라서 모집단의 특성을 알기 위하여 표본을 추출한 후, 통계랑을 통해 모수를 구한다.
● 수치에 대한 분포를 그리기 위해서는...
이산형 : 수치지만 범주로 존재함 (방문자수 (ex_3.5명이라 할 수 없음) -> 히스토그램
연속형 : 그 어떤 수치도 존재할 수 있음 (키, 체중) -> KDE
이산형 수치데이터를 함수로 나타내면 확률질량함수, 연속형 수치데이터를 함수로 나타내면 확률밀도함수
● 범주에 대한 시각화는...
막대그래프, 파이그래프
-02 표본추출
- 단순 무작위 추출
- 계통 추출 (ex : 100번째 사람마다 추출)
- 층화 추출 (ex : 지역별 여론조사 등)
- 군집 추출 (ex : 빨간색, 검은색 공을 나누어 주고 검은색 공을 받은 그룹만 추출)
● 층화 추출과 군집추출의 차이 :
층화 추출과 군집추출 모두 다 그룹을 나누어 표본을 추출하지만, 군집추출은 특정 군집에서만의 표본을 추출하는 특성이 있다.
● 표본 오차, 표본 편의
| 표본 오차 | 비표본 오차 | 표본 편의(bias) |
| 모집단을 대표할 수 있는 표본 단위들이 조사대상으로 추출되지 못하기 때문에 발생하는 오차이다. | 표본 오차를 제외한 모든 오차이다. | 표본추출 과정에서 발생하는 추정값의 기댓값과 모수의 차이이다. |
| 표본의 크기가 커질수록 표본 오차는 작아지며, 전수 조사 시 표본 오차는 0이 된다. | 비표본 오차는 표본의 크기에 비례하며 커진다. | 조사 편의. 조사를 한 쪽 대상에만 편향하여 조사했을 시 편의가 발생한다. 원인을 제거하였을 시 확률화를 통해 최소화하거나 없앨 수 있다. |
-03 측정과 척도
● 측정과 척도
1) 질적 척도(문자)
- 명목척도
- 순서척도(서열척도)
2) 양적 척도(숫자)
- 구간척도(등간척도)
- 비율척도 : 절대적 0을 가짐 (ex : 온도가 0도라고 해서 온도가 존재하지 않는 것은 아니다. 지능이 0이라고 해서 지능이 존재하지 않는 것은 아니다.)
● 데이터 특성에 따른 분류
1) 범주형(Categorica) 데이터
- 명목형 : 순서와 상관이 없는 정성 데이터
- 순서형 : 순서와 상관이 있는 정성 데이터
2) 수치형(Measure) 데이터
- 이산형 : 숫자지만 허용 범위가 존재하는 데이터
- 연속형 : 구간 내의 모든 값이 허용되는 데이터(중간값 정의 가능)
-04 기초 통계량
● 통계량 : 표본에 대한 관찰값
1) 평균(Mean)
수치에 민감하다 = 이상값에 민감하다.
1,2,3,4,100이 있다면 100쪽으로 이동하게 된다.
2) 중앙값(Median)
중앙값은 위치 기반으로 중심을 측정하는 지표로 이상치에 대한 영향을 덜 받는다.
1,2,3,4,100이 있다면 중앙값은 3이 된다.
따라서 이상치가 있는 데이터에서 유용하게 사용된다.
3) 최빈값(Mode)
데이터 중 가장 빈번하게 나타나는 값으로 데이터가 짝수 개수인 경우 최빈값이 두 개 이상 나타나기도 한다. (다중 최빈값 존재 가능)
1, 2, 2, 2, 2, 4, 5 -> 2
1, 2, 2, 2, 3, 3, 3 -> 2,3
● 산포도(Dispersion)
범위 : 데이터 집합에서 최댓값 - 최솟값
● 표본분산 : 편차(평균과 떨어진 거리) 제곱의 합을 자유도(n-1)로 나눈 값
편차는 양수, 음수 둘 다 존재할 수 있기 때문에 제곱을 통해 모두 양수로 맞추어준다.
n으로 나누게 되면 수학적 분산, n-1으로 나누게 되면 통계학적 분석.
자유도가 n-1이 되는 이유는...
평균이 3, 데이터가 1, 2, 3, 4, x 라면 평균이 결정된 순간 x는 절대적으로 고정된다.
따라서 내 데이터 중에 자유롭게 변환될 수 있는 데이터의 개수는 고정된 1개의 값을 제외한 n-1개가 된다.
=> 데이터의 크기가 커질수록 n과 n-1은 근사해진다.
=> 빅데이터 기준으로 무엇으로 나누는지에 대한 차이는 작아지지만 수식상 자유도는 n-1을 사용한다.
● 표본표준편차
분산 혹은 편차가 커졌을 때, 연속형 변수의 분포 등에 대한 시각화가 어려워진다.
따라서 제곱근을 통해 수치를 원래 데이터의 단위로 표현한다.
● 사분위수 범위 (Q3 - Q1)
boxplot을 그린다고 가정하였을 때, 네모로 그려지는 부분이 IQR(사분위수 범위)이다.
50%의 데이터가 위치하는 범위를 나타낸다.
● 상대표준편차(변동계수-CV) (중요)
단위가 상쇄되는 효과
서로 단위가 다른 두 집단의 산포를 비교했을 때, 단위가 큰 쪽이 단위 때문에 분산이 크게 나오는 경향이 있다.
따라서 이와 같은 경우 상대표준편차를 통해 비교해야 한다.
=> 따라서 표본표준편차를 사용해야할지, 상대표준편차를 사용해야할지 잘 생각해야 한다.
데이터 분포
● 왜도(Skewness)
데이터 분포가 비대칭인 정도를 나타내는 수치.
꼬리가 좌측에 있을 때(왼쪽 편포) 음의 왜도, 우측에 있을 때 양의 왜도
● 첨도(Kurtosis)
데이터 분포의 꼭대기(중앙)이 얼마나 높은지 나타내는 수치.
첨도는 3을 기준으로 3보다 크면 데이터가 뾰족(밀집)하며, 작으면 꼬리가 평평한 분포를 나타낸다.
3에 가까울수록 정규분포와 비슷하다.
표준정규분포(평균분포 : 0, 표준편차 : 1) 일 경우 첨도가 3을 나타내기 때문에 3을 기준으로 정규분포 여부를 확인한다.
때로는 3을 빼서 0과 비교하기도 한다.
-05 확률과 확률분포
어떤 사건이 일어날 가능성을 수치적으로 나타내는 개념으로, 0과 1 사이의 값으로 표현함.
확률 = 사건이 발생할 경우의 수 / 전체 경우의 수
확률실험, 표본공간, 사건, 확률변수, 확률분포, 확률질량함수, 확률밀도함수 등 용어 파악 필요
● 확률과 확률실험
1) 확률실험
- 각 실험 반복
- 각 반복마다 일정한 확률
- 예상되는 결과가 정해져있지만 실제 값은 알수없음
2) 사건
- 확률실험을 통해서 관심을 갖게 되는 특정 실험
- 동전을 던져서 앞면이 나오는 사건
3) 확률변수
- 사건에서 얻을 수 있는, 수치로 표현 가능한 대상
- 사건의 결과이면서 각 결과마다의 확률값을 알 수 있음
ex) 동전던지기 실험을 5번 반복해서 얻게되는 앞면이 나오는 횟수(x)
P (x = 0) : TTTTT
▶ 0.5 ^ 5 = 0.03125
> 0.5 ^ 5
[1] 0.03125
P (x = 1) : HTTTT, THTTT, TTHTT, TTTHT, TTTTH
▶ 5 * 0.5 ^ 5 = 0.15625
▶ 5c1 * (0.5) ^ 1 * (0.5) ^ 4 = 0.15625
5c1은 R에서 choose라는 함수로 계산 가능함. (5번 중 1번 성공할 수 있는 수)
> choose(5,1)*(0.5)^1*(0.5)^4
[1] 0.15625
P (x = 2) : HHTTT, HTHTT, ...
▶ choose(5,2) * (0.5) ^ 2 * (0.5) ^ 3 = 0.3125
> choose(5,2)*(0.5)^1*(0.5)^4
[1] 0.3125
P (x = 3) : HHHTT, HHHT, ...
▶ choose(5,3) * (0.5) ^ 3 * (0.5) ^ 2 = 0.3125
> choose(5,3) * (0.5) ^ 3 * (0.5) ^ 2
[1] 0.3125
P (x = 4) : HHHHT, ...
▶ choose(5,4) * (0.5) ^ 4 * (0.5) ^ 1 = 0.15625
> choose(5,4) * (0.5) ^ 4 * (0.5) ^ 1
[1] 0.15625
P (x = 5) : HHHHH
▶ choose(5,5) * (0.5) ^ 5 * (0.5) ^ 0 = 0.03125
> choose(5,5) * (0.5) ^ 5 * (0.5) ^ 0
[1] 0.03125
● 분포 시각화
확률분포는 x가 n일 때, y(p(x))가 어떻게 되는지 보여준다.
-> 확률변수가 가질 수 있는 값들을 x축에, y축에 대응되는 값들을 넣어 시각화한다.
> par(mfrow = c(1, 1))
> barplot(vx, vy)
> barplot(vy, names.arg = vx)

▲ 확률질량함수
● 확률분포의 종류 : 이산확률분포, 연속확률분포
| 이산확률분포(확률질량함수) | 연속확률분포(확률밀도함수) |
| 포아송분포 | 정규분포 |
| 베르누이분포 | 표준정규분포 |
| 이항분포(성공횟수 : 자유투 성공률 등) | t분포 |
| 초기하분포 | 카이제곱분포 |
| 기하분포 | F분포 |
| 음이항분포 | |
| 다항분포 |
모평균을 표본평균으로부터 얻기 위해서 어느 쪽이 더 큰지, 작은지 확인할 때 사용하는 것이 t분포.
=> 모평균과 관련된 분포는 정규분포, t분포.
카이제곱분포
분산과 관련된 분포이다. 표본분산이 가지는 분포가 카이제곱이며, 분산추정을 할 때 가정하는 분포가 카이제곱분포이다.
하나의 집단에서의 분포를 확인할 때 사용한다.
F분포
두 집단의 분산이 같은지 아닌지에 대한 확인을 할 때 사용하는 분포이다.
모수 - 통계량과 대응되는 모집단의 특성
- 확률 분포에서의 분포 특성 (확률분포를 다르게 결정짓는 요인)
● 베르누이 분포
성공 혹은 실패로만 구성되어 있으며, 단 1번만 실행하는 경우에 한정한다.
성공 혹은 실패로만 구성되어 있는 실험을 베르누이 실험이라한다.
E(X) = p
Var(X) = p(1-p)
● 이항분포
- 이산형 확률분포
- 베르누이 시험을 n0회 반복했을 때 성공횟수(X)가 따르는 분포
- 모수 : n(시행 횟수), p(성공 확률)
- X ~ B (n,p)
E(X) = np
Var(X) = np(1-p)
[이항분포 예제]
자유투 성공률이 0.8인 선수가 경기에 나갔을 때, 자유투 성공을 하기까지 몇 번(x)의 시도를 해야하는가 : 시도횟수가 확률변수
베르누이분포는 단 1회 시도했을 때의 성공률을 말한다. 이 베르누이분포가 n회 누적되었을 때가 이항분포.
그러나 이항분포가 지속적으로 반복되는 경우 정규분포의 형태를 가지게 된다.
* in R) 자유투 성공률이 0.8인 a선수가 총 10번 자유투를 던졌을 때 4번 성공할 확률은?
확률변수 (x) : 총 10번 자유투 성공횟수
x ~ b(10, 0.8)
P(X=x) = nCx * p^x * (1-p)^n-x
P(X=4) = 10C4 * 0.8^4 *(0.2)^6
> choose(10,4) * 0.8^0.4 * (0.2)^6
[1] 0.01229236
# R에서 사용 가능한 확률 함수
1. 확률질량/밀도 함수 : dbinom() [ 이항분포일 때 dbinom, 정규분포일 때 dnom, t분포일 때 dtnom ... ]
dbinom(x, # 성공횟수
size, # 시행횟수
prob) # 성공확률
* 이항분포 시각화
1) n의 변화에 따른
> v1 <- rbinom(100, 10, 0.5)
> v2 <- rbinom(100, 20, 0.5)
> v3 <- rbinom(100, 30, 0.5)
> par(mfrow=c(1,3))
> par('mar' = c(5,5,4,2))
> hist(v1, breaks = 0:30)
> hist(v2, breaks = 0:30)
> hist(v3, breaks = 0:30)

2) p의 변화에 따른
> v1 <- rbinom(100, 10, 0.1)
> v2 <- rbinom(100, 10, 0.5)
> v3 <- rbinom(100, 10, 0.9)
> par(mfrow=c(1,3))
> par('mar' = c(5,5,4,2))
> hist(v1, breaks = 0:10, prob = T)
> hist(v2, breaks = 0:10, prob = T)
> hist(v3, breaks = 0:10, prob = T)

2. 누적분포함수 : p____
3. 퍼센트포인트함수 : q____
4. 랜덤샘플링 : r____
'아이티윌_데이터 분석 55기 > 강의내용 필기_통계 및 분석' 카테고리의 다른 글
| #3 3일차_이산확률분포, 중심극한정리, 모평균 추정, 가설검정 (0) | 2026.04.15 |
|---|---|
| #2 2일차_추론, 확률분포, 정규분포, 표준정규분포, 중심극한정리 (0) | 2026.04.14 |
| #10 10일차_ggplot2 (0) | 2026.04.13 |
| #9 9일차_기본 시각화 : barplot, 이상치 탐색, 히스토그램, 커널밀도, 파이차트 (0) | 2026.04.10 |
| #8 8일차_dplyr, 시각화 (0) | 2026.04.09 |