
★ 자료의 탐구
◎ 그래프
○ 변수
- 범주변수(categorical variable) : 몇 개의 그룹(범주) 중 하나에 속하도록 분류. (ex. 남성, 여성 등)
- 정량변수(quantitative variable) : 합산·평균 등 계산이 가능하도록 숫자 값을 취함. 측정단위로 기록. (ex. 키, 몸무게 등)
○ 그래프
- 원 그래프 : 전체 구성하는 모든 범주를 포함해야 함. 각 범주와 전체와의 관계를 강조하고자 할 경우에 사용.
- 막대 그래프 : 막대의 높이 = 범주의 총계 or 백분율. 원 그래프보다 더 유연. 동일한 단위로 측정한 수량 비교 가능.
- 히스토그램 : 정량변수의 분포를 나타내는 가장 보편적인 그래프. 자료의 범위를 동일한 폭을 갖는 등급으로 나누고 등급에 속한 개체의 수를 셈. 수평축 = 해당 변수의 측정 단위. 해당 변수의 모든 값이 포함될 수 있도록 여백을 두지 않음.

- 스템플롯 : 규모가 작은 경우 더 신속하게, 더 자세한 정보 제시 가능.

- 타임플롯 : 시간의 흐름에 따라 발생하는 변화를 보여줌.

- 박스플롯 : {최솟값, $Q_1$, $M(Q_2)$, $Q_3$, 최댓값}을 보여줌. 한 개를 초과하는 분포를 비교하는 데 사용.

◎ 숫자를 이용한 분포 설명
- 평균(mean) : $ \bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n} = \frac{1}{n} \sum^{n}_{i=1} x_i $. 극단적인 관찰값에 큰 영향을 받음.
- 중앙값(median) : n이 홀수 ⇒ $ \frac{n+1}{2} $ 번째 자료 / n이 짝수 ⇒ $\frac{n}{2} $ 번째 자료와 $\frac{n}{2} + 1$번째 자료의 중간. 극단적인 관찰값에 영향을 받지 않음. (= 제2사분위수($Q_2$))
- 사분위수(quartile) : 제1사분위수($Q_1$) - 중앙값 왼쪽 관찰값들의 중앙값 / 제3사분위수($Q_3$) - 중앙값 오른쪽 관찰값들의 중앙값
- IQR(Interquartile Range) : $Q_3 - Q_1$
- 이탈값 : $(Q_1 - 1.5 \times IQR, Q_1)$ & $(Q_3, Q_3 + 1.5 \times IQR)$
- 분산(variance) : $s^2 = \frac{(x_1 - \bar{x})^2 + (x_2 - \bar{x})^2 + \cdots + (x_n - \bar{x})^2}{n-1} = \frac{1}{n-1} \sum^{n}_{i=1}(x_i - \bar{x})^2$. 평균값에 대해 퍼진 정도를 보여주는 값. 저항력이 없어 극단적인 관찰값에 큰 영향을 받음. 분모의 $n-1$은 자유도.
- 표준편차(standard deviation) : $ s = \sqrt{ \frac{1}{n-1} \sum^{n}_{i=1} (x_i - \bar{x})^2 } $
- 분산 및 표준편차에서 $n-1$로 나누는 이유 : 편차의 합은 항상 0 ⇒ $n-1$개만이 자유롭게 변할 수 있음($n-1$이 마지막 것을 결정)
- 모분산, 모표준편차의 경우 $N$으로 나눔.
○ 밀도곡선(density curve) : 수평축 혹은 그 위에 있는 곡선. 곡선 아래의 면적이 정확히 1이 되는 곡선.

- 오른쪽으로 긴 꼬리를 가진 분포의 경우 : 중앙값 < 평균
- 왼쪽으로 긴 꼬리를 가진 분포의 경우 : 중앙값 > 평균
◎ 정규분포(Normal distribution) : 대칭적. 종 모양.

○ 표준화 : $z = \frac{x- \mu}{\sigma} $
○ 표준정규분포 : N(0, 1). 평균값 0, 표준편차 1인 정규분포.
◎ 산포도 및 상관
○ 산포도(scatterplot) : 동일한 개체에 대해 측정한 두 개 정량변수 사이의 관계를 보여주는 그림. (설명변수→x축, 반응변수→y축)

○ 상관(correlation) : $ r = \frac{1}{n-1} \left[ \left(\frac{x_1 - \bar{x}}{S_x}\right) \left( \frac{y_1 - \bar{y} }{S_y}\right) + \left(\frac{x_2 - \bar{x}}{S_x}\right) \left( \frac{y_2 - \bar{y} }{S_y}\right) + \cdots + \left(\frac{x_n - \bar{x}}{S_x}\right) \left( \frac{y_n - \bar{y} }{S_y}\right)\right] = \frac{1}{n-1} \sum^{n}_{i=1} \left( \frac{x_i - \bar{x}}{S_x}\right) \left( \frac{y_i - \bar{y}}{S_y}\right) $
- 관찰값들의 표준화된 값을 사용 ⇒ ∴ x, y 측정단위가 변해도 상관 r은 변화하지 않음. -1 ≤ r ≤ 1
- r이 0에 근접 ⇒ 매우 약한 선형관계 / r = 1 ⇒ 완전한 양의 선형관계 / r = -1 ⇒ 완전한 음의 선형관계
- 저항력이 없어 극단적인 관찰값에 큰 영향을 받음.
◎ 회귀(regression) : 설명변수 $x$가 변화함에 따라 반응변수 $y$가 어떻게 변화하는지를 보여줌.
- $ \hat{y} = a + bx , ~ b = r \frac{S_y}{S_x}, ~ a = \bar{y} - b \bar{x} $
- $a$ : 절편 / $b$ : 기울기, 반응의 변화율.
- $r^2 = \frac{x가 ~변화하면서~ 회귀선을~ 따라~ 나타나는~ \hat{y}의~ 변동}{y의~ 관찰값의~ 총~ 변동} $
- 자료의 $r^2$%가 선형관계로 설명. (최소제곱 회귀식으로 설명할 수 있는 어떤 변수의 변동 비율)
- 두 변수 간 강한 연관관계 ≠ 두 변수 간 강한 인과관계
○ 잔차(residual) : $ y - \hat{y} $. 최소제곱 잔차의 평균값은 항상 0.
◎ 이원분류표
○ 주변분포(marginal distribution) : 해당 표로 설명되는 모든 변수들 사이에서 해당 변수 값의 분포. 전체에서 해당 값 비율.
○ 조건부분포(conditional distribution) : 다른 변수의 주어진 값을 갖는 개체들 사이에서 해당 변수 값의 분포. 조건에서 해당 값 비율.
ㆍEx.

- A, B, C 한계분포 ⇒ A : $\frac{10}{40} = 0.25 $ / B : $\frac{20}{40} = 0.5 $ / C: $\frac{10}{40} = 0.25 $
- B에서의 男, 女 조건부분포 ⇒ 男 : $\frac{12}{20} = 0.6 $/ 女 : $\frac{8}{20} = 0.4$
○ 심슨의 역설(Simpson's Paradox) : 자료를 결합시켜 합할 경우 추세가 역전되는 현상

'통계 이론 > 통계학개론' 카테고리의 다른 글
| 통계학 개론 정리 04. 관계 추론 (0) | 2022.08.11 |
|---|---|
| 통계학 개론 정리 03. 변수 추론 (0) | 2022.08.11 |
| 통계학 개론 정리 02. 표본 (0) | 2022.08.10 |