본문 바로가기

통계 이론/통계학개론

통계학 개론 정리 04. 관계 추론

카이-제곱 검정(chi-square test)

 

  • 두 개의 범주 변수 간 관계가 존재하는지 검정
    • $H_0$ : 두 개의 범주 변수 간 연관관계 X
    • $H_1$ : 두 개의 범주 변수 간 연관관계 O
    • $Reject~H_0$ : 연관관계가 있다는 좋은 증거가 될 수 있음
  •  $\chi^2 = \sum \frac{ (\text{관찰횟수 - 기대횟수})^2 }{\text{기대횟수}} $
  • 기대 횟수 = $\frac{ \text{행의 합계} \times \text{열의 합계} }{\text{표의 총합}} $
  • 자유도(df) = (r-1)(c-1) (r : 행 개수, c : 열 개수)

○ Ex)

$ \chi^2 = \frac{(104 - 157.98)^2}{157.98} + \frac{(96 - 42.02)^2}{42.02} + \frac{(265-264.62)^2}{264.62} + \frac{(70-70.38)^2}{70.38} + \frac{(204 - 181.68)^2}{181.68} + \frac{(26 - 48.32)^2}{48.32} + \frac{(179 - 147.71)^2}{147.71} + \frac{(8- 39.29)^2}{39.29} = 132.39$

$df = (4-1)(2-1) = 3$

⇒ df = 3에서 P-value = 0.05인 값은 7.81, $\chi^2$는 132.39이므로 p-value < α (p-value ≒ 0)

∴ $Reject~H_0$ ⇒ 두 개의 범주 변수 사이 연관이 있다는 강한 증거 ⇒ 무선 전화기를 사용하는 인원들이 더 젊다고 볼 수 있는 증거

 

○ 적합도 검정의 방법도 동일

  • $H_0 : p_1 = p_{10}, p_2 = p_{20}, \cdots , p_k = p_{k0} $, $df = k-1$

 

회귀

 

○ $\mu_y = \alpha + \beta x $

  • $\hat{\beta} = \frac{ S_{xy} }{ S_{xx} } = \frac{ \sum(X_i - \bar{X})(Y_i - \bar{Y}) }{ \sum (X_i - \bar{X})^2 }$
  • $\hat{\alpha} = \bar{y} - \hat{\beta}\bar{x} $

○ ANOVA TABLE

 

  • 회귀 표준오차 $s = \sqrt{ \frac{1}{n-2} \sum^n_{i=1} (y - \hat{y})^2 }$
  • 선형관계 존재하지 않는다는 가설 검정 ⇒ $H_0 : \beta = 0 $ / $H_1 : \beta \neq 0 $

평균 반응을 예측하기 위해서는 신뢰구간을 사용

  • $\mu_y = \alpha + \beta x^{*}$ ⇒ 신뢰구간 : $\hat{y} \pm t^{*} SE_{\hat{\mu}} $ / 표준오차 : $SE_{\hat{\mu}} = s \sqrt{ \frac{1}{n} + \frac{(x^{*} - \bar{x})^2}{\sum (x - \bar{x})^2}  }$

개별 반응을 예측하기 위해서는 예측구간을 사용

  • 단일 무작위 반응 $y$에 대한 예측구간 : $\hat{y} \pm t^{*} SE_{\hat{\mu}} $ / 표준오차 : $SE_{\hat{\mu}} = s \sqrt{ 1 +  \frac{1}{n} + \frac{(x^{*} - \bar{x})^2}{\sum (x - \bar{x})^2}  }$

일원분류분산분석 : 몇 개의 평균들의 비교

 

※ 분산분석 : 표본평균들이 얼마나 차이가 나는지를 표본 내 변동이 얼마나 큰지와 비교함으로써 몇 개 모집단들이 동일한 평균을 갖는지 여부를 검정

 

$H_0 : \mu_1 = \mu_2 = \mu_3$ / $H_1 : not~H_0 $

  • $ \bar{Y_{1\cdot}} = \frac{1}{n}\sum^n_{j=1} Y_{1j} , \bar{Y_{2\cdot}} = \frac{1}{n}\sum^n_{j=1} Y_{2j}, \cdots \bar{Y_{a\cdot}} = \frac{1}{n}\sum^n_{j=1} Y_{aj}$
    ($Y_{ij}$ : $i$번째 그룹, $j$번째 관찰값)
  • $ \bar{Y_{\cdot\cdot}} = \frac{1}{an}\sum^a_{i=1}\sum^n_{j=1} Y_{aj}$
  • ANOVA F 검정의 결과는 가장 큰 표본표준편차가 가장 작은 표본표준편차의 두 배를 초과하지 않을 때 대략적으로 옳음.
  • $F = \frac{MSG}{MSE}$
    • $MSG = \frac{n_1(\bar{x_1} - \bar{x})^2 + n_2(\bar{x_2} - \bar{x})^2 + \cdots + n_I(\bar{x_I} - \bar{x})^2}{I-1}$
    • $MSE = \frac{(n_1 - 1)s_1^2 + (n_2 - 1)s_2^2 + \cdots + (n_I - 1)s_I^2}{N-1}$
    • $H_0~True$ ⇒ $F_{(I-1, N-1)}$인 F 분포를 가짐.