본문 바로가기

전체 글

(68)
Python Project 03. Classification Model 0. Train / Test Split ◎ 분류 모델을 학습하기 위한 Train, Test Set을 생성. ○ train.txt / test.txt # train, test txt file import random as rd all_num = list(np.arange(1, 501)) train_num = rd.sample(all_num, int(len(all_num) * 0.8)) test_num = list(set(all_num).difference(train_num)) f = open('train.txt', 'w') # train.txt 생성 for i in range(0,2): for n in train_num: data = path + 'apple_' + str(i) +'_' + format(n..
Python Project 02. 데이터 전처리 및 프로그래밍 준비 1. 데이터 전처리 - 수집한 이미지들을 불러오고 이미지 크기를 확인한 결과, 이미지들의 크기가 다름. ⇒ 모델 훈련을 위해 이미지 크기를 맞추는 것이 필요. ⇒ 모든 이미지를 "256×256×3" 형식으로 맞춤. ('알씨' 프로그램을 이용하여 일률적으로 수정) - 이미지 파일의 라벨링을 변경 ⇒ 과수화상병 중 '사과탄저병' 만을 사용 & 질병의 유무만을 확인할 예정 ⇒ 병이 없는 정상 이미지의 경우 'apple_0_(num).jpg' / 탄저병이 있는 이미지의 경우 'apple_1_(num).jpg' 로 rename. ○ 데이터 전처리 과정이 끝난 이미지 파일들 - https://github.com/zaegeon/Project/tree/main/apple GitHub - zaegeon/Project C..
Python Project 01. 주제 선정 및 데이터 수집 - 아이티윌 교육센터에서 진행한 팀 프로젝트 정리. 0. 프로젝트 주제 선정 - 주제 후보 김해시 CCTV 공모전 미세먼지 예측 식물 정상 / 비정상 이미지 분류 모델 생성 환경 조건에 따른 병 심각도 조사 게임 / 영화 리뷰 분석(텍스트마이닝) 온라인 쇼핑 동향을 이용한 성별, 계절별 쇼핑 아이템 추천 네이버 지도를 이용한 음식점 창업 위치 추천 기상에 따른 혈관질환 발생 예측 소방안전 빅데이터를 활용한 재난 방지 or 소방 시설 개선 방안 등 조사 서울시 노인 현황 및 관련 시설 현황을 조사하여 특정 구에 추가 노인 시설을 설립할 효율적인 방안 모색 https://data.seoul.go.kr/dataList/10020/S/2/datasetView.do - 서울시 고령자 통계 https://data...
통계학 개론 정리 04. 관계 추론 ◎ 카이-제곱 검정(chi-square test) 두 개의 범주 변수 간 관계가 존재하는지 검정 $H_0$ : 두 개의 범주 변수 간 연관관계 X $H_1$ : 두 개의 범주 변수 간 연관관계 O $Reject~H_0$ : 연관관계가 있다는 좋은 증거가 될 수 있음 $\chi^2 = \sum \frac{ (\text{관찰횟수 - 기대횟수})^2 }{\text{기대횟수}} $ 기대 횟수 = $\frac{ \text{행의 합계} \times \text{열의 합계} }{\text{표의 총합}} $ 자유도(df) = (r-1)(c-1) (r : 행 개수, c : 열 개수) ○ Ex) $ \chi^2 = \frac{(104 - 157.98)^2}{157.98} + \frac{(96 - 42.02)^2}{42.02..
통계학 개론 정리 03. 변수 추론 ◎ 모평균 추론 ○ t 분포 : "σ를 알지 못할 때" 사용. $ t = \frac{\bar{x} - \mu}{s / \sqrt{n}} $, 자유도(df) : $n-1$ 자유도가 증가할수록 $N(0,1)$에 근접. t 신뢰구간 : $\bar{x} \pm t^{*} \frac{s}{\sqrt{n}} $ 단수표본 t 검정 : $ t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}} $ ($H_0 : \mu = \mu_0 $) ○ 짝을 이룬 쌍 t 절차(pairwise t) : $X_2 - X_1 \sim (\mu_2 - \mu_1, \sigma^2) $ t 절차 사용 : n < 15 : 자료가 거의 정규분포이면 t 절차 사용 O / 명백하게 한 쪽으로 기울었거나 이탈값이 존재한다면 t 절..
통계학 개론 정리 02. 표본 ★ 탐구로부터 추론으로의 전환 ◎ 표본추출 ○ 표본(sample) : 실제로 정보를 수집한 모집단의 일부분 편리표본(convenience sample) : 접하기 가장 용이한 모집단의 구성원들을 선택한 표본. 대표성 ↓ ○ 편의(偏倚, bias) : 잘못된 표본추출 설계로 인해 발생한 체계적인 오차. 자발적인 응답 표본과 같은 경우 편의 발생. ○ 단순 무작위 표본(SRS, Simple Random Sample) : n개 개체들의 모든 세트가 실제로 선택된 표본이 될 수 있는 동등한 기회를 갖는 방법 ○ 층화된 무작위 표본(Stratified Random Sample) : 층(stratum)이라고 하는 유사한 개체들의 그룹으로 분류하여 층에서 별개의 단순 무작위 표본을 선택하고, 그 표본들을 혼합하여 완..
통계학 개론 정리 01. 통계학의 기초 ★ 자료의 탐구 ◎ 그래프 ○ 변수 범주변수(categorical variable) : 몇 개의 그룹(범주) 중 하나에 속하도록 분류. (ex. 남성, 여성 등) 정량변수(quantitative variable) : 합산·평균 등 계산이 가능하도록 숫자 값을 취함. 측정단위로 기록. (ex. 키, 몸무게 등) ○ 그래프 원 그래프 : 전체 구성하는 모든 범주를 포함해야 함. 각 범주와 전체와의 관계를 강조하고자 할 경우에 사용. 막대 그래프 : 막대의 높이 = 범주의 총계 or 백분율. 원 그래프보다 더 유연. 동일한 단위로 측정한 수량 비교 가능. 히스토그램 : 정량변수의 분포를 나타내는 가장 보편적인 그래프. 자료의 범위를 동일한 폭을 갖는 등급으로 나누고 등급에 속한 개체의 수를 셈. 수평축 = 해..
Python Day 34 - Machine Learning part 14. CNN ◎ CNN (Convolutional Neural Network, 합성곱 신경망) ○ Imports import numpy as np import matplotlib.pyplot as plt from scipy.signal import convolve, convolve2d, correlate, correlate2d from sklearn import datasets from sklearn.model_selection import train_test_split import tensorflow as tf from tensorflow import keras ● Convolutional(합성곱) 연산 ○ 1-D Convolution ㆍ'valid' x = np.arange(1, 5) x >> array([1, ..