★ 탐구로부터 추론으로의 전환
◎ 표본추출
○ 표본(sample) : 실제로 정보를 수집한 모집단의 일부분
- 편리표본(convenience sample) : 접하기 가장 용이한 모집단의 구성원들을 선택한 표본. 대표성 ↓
○ 편의(偏倚, bias) : 잘못된 표본추출 설계로 인해 발생한 체계적인 오차. 자발적인 응답 표본과 같은 경우 편의 발생.
○ 단순 무작위 표본(SRS, Simple Random Sample) : n개 개체들의 모든 세트가 실제로 선택된 표본이 될 수 있는 동등한 기회를 갖는 방법
○ 층화된 무작위 표본(Stratified Random Sample) : 층(stratum)이라고 하는 유사한 개체들의 그룹으로 분류하여 층에서 별개의 단순 무작위 표본을 선택하고, 그 표본들을 혼합하여 완전한 표본을 만듦.
ㆍ과소적용(undercoverage) : 모집단 내 일부 그룹이 표본을 선택하는 과정으로부터 배제된 경우 발생.
ㆍ무응답(nonresponse) : 어떤 표본에 뽑힌 사람을 접촉할 수 없거나 참여하기를 거절하는 경우 발생.
- 무작위 표본이라도 과소적용, 무응답, 잘못된 문구의 질문으로 인한 오도된 결과를 가질 수 있음.
◎ 실험
○ 관찰적 연구 : 개체 관찰, 관심있는 변수 측정. 응답에 영향 X vs. 실험 : 처리를 사려 깊게 시행. 처리가 반응의 변화를 일으키는지 관찰.
○ 실험 설계의 원칙 : ① 통제 ② 무작위화 ③ 충분한 피실험자 사용
└ 피실험자 : 연구의 대상이 되는 개체 / 요인 : 설명변수 / 처리 : 피실험자에 대해 적용하는 특정의 실험 조건
★ $H_0$ : 귀무가설 / $H_1$ : 대립가설 ⇒ $H_0$(귀무가설) 기각 ⇒ 통계적으로 유의
○ 이중맹검법(double-blind) : 피실험자 & 상호작용하는 사람들 모두 피실험자가 어떤 처리를 받는지 알지 못함(대조군에게 대조약 제공)
○ 블록(block) : 처리에 대한 반응에 영향을 미칠 것으로 기대되는 점에서 실험 전에 유사하다고 알려진 개체들의 그룹
└ 비교 이외의 통제의 두 번째 형태 - 유사한 개체들의 블록을 만들어서 무작위화, 블록 내에서 따로따로 무작위화 시행
└ 짝을 이룬 쌍 ⇒ 두 개의 처리를 비교하기 위해서 블록화하는 일반적인 형태
◎ 확률
○ 확률(Probability) : $\frac{해당~사건}{전체~사건}$. 0 ≤ $P$ ≤ 1.
불가능, 절대 발생 X : $P=0$ / 확실, 시도할 때마다 발생 : $P=1$
- 1) $ 0 \le P(A) \le 1 $
- 2) $P(S) = 1 $
- 3) A와 B가 별개의 사건 ⇒ $P(A~or~B) = P(A) + P(B) $
- 4) $ P(Not~A) = 1 - P(A) $
○ 표본공간(Sample Space, S) : 모든 가능한 결과의 집합. $P(S) = 1$
○ 유한한 확률 모형 : 합산하면 정확히 1 vs. 연속적 확률 모형 : 밀도곡선 아래의 면적으로 확률 배정.
○ 이산적 확률 변수 : 유한한 결과를 갖는 변수들 vs. 연속적 확률 변수 : 밀도곡선 아래의 면적으로 확률을 나타냄. 구간 내 어떤 값도 취할 수 있음.
○ 모평균 $\mu$, 모표준편차 $\sigma$ / 표본평균 $\bar{x}$, 표본표준편차 $s$. $\bar{x}$는 $\mu$의 불편추정량.
- 표본이 커질수록 통계량 $\bar{x}$는 모수 μ에 점점 근접함. $ \left(\displaystyle \lim_{n \to \infty } \bar{x} = \mu \right) $
◎ 표본분포
○ 표본분포 : 동일한 모집단으로부터 추출한 동일 규모의 모든 가능한 표본들에 대한 해당 통계량 값의 분포
○ $ X \sim N(\mu, \sigma) $ ⇒ $\bar {X} \sim N(\mu$, $\frac{\sigma}{\sqrt{n}}$)
- 중심 극한 정리에 따르면 n이 클 경우 표본평균 $\bar{x}$의 표본분포는 대략적으로 정규분포.
- 무작위 표본들의 평균은 개별관찰값보다 덜 변동, 더 정규분포의 형태를 띔.
◎ 확률의 일반 법칙
○ 독립사건 : 다른 사건이 발생할 확률을 변화시키지 않는 사건. 서로 영향을 미치지 않는 사건.
- A, B가 독립사건 ⇒ $P(A \cap B) = P(A)P(B) $
- c.f.) A, B가 배반사건 ⇒ $P(A \cap B) = \varnothing $
○ 조건부확률(conditional probability) : $ P(B|A) = \frac{P(A \cap B)}{P(A)} $. A 중에서 B인 확률.
- $P(A \cap B) = P(A)P(B|A) $
- $P(A \cap B) = P(A)P(B|A) = P(A)P(B)$ ⇒ $P(B) = P(B|A)$이면 $A, B$는 독립사건
◎ 이항분포(Binomial Distribution) : 두 개의 상반된 결과 중 관심 있는 것이 성공확률 p로 일정할 때, n개의 시행 중 성공 횟수가 k개인 경우의 확률분포.
- $X \sim B(n,p) $. $X$ : 성공 개수
- $P(X=k) = \binom{n}{k} p^k (1-p)^{n-k}$.$~ \binom{n}{k} = \frac{n!}{k!(n-k)!} $
- 이항분포 $X$의 관찰값 $n$이 클 경우, $X \sim N\left ( np, \sqrt{np(1-p)} \right ) $ ($np \ge 10 ~~ or ~~ n(1-p) \ge 10$일 때)
○ 기댓값(Expected Value) : $E(X) = \sum^n_{x=1}x P(x) $.
$X \sim B(n,p)$ ⇒ $E(X) = np (=\mu) $
○ 분산(Variance) : $V(X) = E(X - E(X))^2 = E(X^2) - \left\{E(X) \right\}^2 $
$X \sim B(n,p)$ ⇒ $V(X) = np(1-p) (=\sigma^2) $
◎ 신뢰구간
○ 평균에 관한 추론을 하기 위해 필요한 단순조건
① 단순 무작위 표본
② 모집단에서 정확한 정규분포 $N (\mu, \sigma)$를 따름
③ $\mu$를 알지 못함, $\sigma$를 알고 있음
○ 신뢰구간 : 추정값 ± 오차한계
- 모수 $\mu$에 대한 신뢰구간 : $\bar{X} ~ \pm ~ $($\bar{X}$ 분포에 따른 한계값) × ($\bar{X}$ 표준편차) = $\bar{X} \pm Z_{\frac{\alpha}{2}} \sqrt{\frac{\sigma^2}{n}}$
- 한계값(임계값) : 신뢰수준 90% - 1.645 / 신뢰수준 95% - 1.960 / 신뢰수준 99% - 2.576
- $\mu$에 대한 95% 신뢰구간이 (a, b) ⇒ 같은 방법으로 신뢰구간을 100개 구했을 때 그 중 95개의 구간에 $\mu$가 포함될 것이라고 생각하는 구간 중 하나.
◎ 유의성 검정
○ 귀무가설(null hypothesis) : 통계적 검정에 의해 검증되는 주장. "효과가 없다. 차이가 없다."
⇔ 대립가설(alternative hypothesis)
- Ex) 미국 여성들의 평균 소득은 31666$. 지역 소재 고등학교만을 졸업한 사람들의 평균 소득이 전체 평균 소득과 상이한지 여부를 알아보기 위한 가설. ⇒ $H_0 : \mu = 31666 $ / $H_1 : \mu \neq 31666 $
○ P-value : 귀무가설과 상반되는 증거의 강도
- 표준화 후 Z값에 대한 확률로 가설을 검정.
- P-value가 유의수준 α보다 작을 경우, 해당 자료는 α 수준에서 통계적으로 유의하다고 함. (α : 유의수준(significance level))
- Ex) 제품 평균 특성값 15, 16개 표본($\bar{x}=15.7, \sigma = 4$). 유의수준 5%, 증가하는지 검정.
- $H_0 : \mu = 15 $ / $H_1 : \mu > 15 $
- $P-value : P(\bar{X} > 15.7) = P \left(\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} > \frac{15.7-15}{4/\sqrt{16}} \right) = P(Z > 0.7) = 0.2420$.
0.2420 > α ⇒ Fail to Reject $H_0$. 증가한다고 말할 근거가 없음!
- 양측 검정의 경우 : $P-value = 2 \times P(\bar{X} > a) = 2 \times P \left( \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} > \frac{a - \mu}{\sigma/\sqrt{n}} \right) $ 으로 계산
◎ 실제 추론
○ 실제 추론 유의 사항
- 표본에서의 무반응, 실험에서의 탈락과 같은 실제적 문제가 발생하면 추론에 방해가 됨.
- 상이한 설계에 대해서는 상이한 방법이 필요.
- 자발적인 응답조사 or 실험에서의 탈락과 같은 근본적 결함에 대한 해결책은 없음.
- 이탈값은 추론 결과를 왜곡시킬 수 있음.
○ 신뢰구간 유의 사항 : 오차한계는 무작위 표본 오차만을 포함. (과소적용, 무응답처리 등 실질적 문제 고려 X)
○ 유의성 검정 유의 사항 : 표본이 큰 경우 모집단의 효과가 매우 유의. ($\because Z = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}}, Z \propto n$ ⇒ Z가 커질수록 P-value는 작아지므로)
○ 바라는 오차한계에 대한 표본크기 : $n = ( \frac{z^{*} \sigma}{m})^2 $ ($m$ : 오차한계)
○ 검정력(power) : 1 - β (β : 제2종오류의 확률). 대립가설이 참일 때 유의수준 α에서 $H_0$를 기각할 확률.
($P(reject~H_0| H_0 = False)$ , $P(reject~H_0 | H_1$에서의 모수값))
○ 표준오차(standard error) : 통계량의 표준편차가 자료로부터 추정될 때의 결과
'통계 이론 > 통계학개론' 카테고리의 다른 글
| 통계학 개론 정리 04. 관계 추론 (0) | 2022.08.11 |
|---|---|
| 통계학 개론 정리 03. 변수 추론 (0) | 2022.08.11 |
| 통계학 개론 정리 01. 통계학의 기초 (0) | 2022.08.09 |