전체 글 (12)


11. 가설 검정(t 검정, 상관 분석)

11. 가설 검정(t 검정, 상관 분석)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 가설 검정기술 통계: 데이터를 요약해 설명하는 통계 분석 기법ex) 사람들이 받는 월급을 집계해 월급 평균을 계산추론 통계: 단순히 숫자를 요약하는 것을 넘어 표본으로 모집단을 추론하는 통계 분석 기법통계적 추정: 모집단의 진짜 특성(ex 평균, 비율)이 어느 정도인지 추론하는 방법통계적 가설 검정: 모집단에 대한 가설을 세우고, 이를 표본 데이터를 통해 유의 확률을 계산하여 검정하며 모집단을 추론하는 방법 가설: 성별에 따른 월급 차이가 있을 것이다.기술 통계: 표본 데이터에서 성별에 따라 월급 차이가 있는 것으로 나타난다.통계적 가설 검정: 이런 차이가 우연히 발생할..

10. 인터랙티브 그래프(plotly 패키지)

10. 인터랙티브 그래프(plotly 패키지)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 인터랙티브 그래프 준비plotly 패키지 설치: 아나콘다 프롬프트에 pip install plotly 작성plotly 패키지: 인터랙티브(마우스 움직임에 반응하며 실시간으로 모양이 변하는) 그래프를 생성하는 패키지jupyter-dash 패키지 설치: 아나콘다 프롬프트에 pip install jupyter-dash 작성jupyter-dash 패키지: plotly로 만든 그래프를 노트북에 출력하는 패키지패키지 모두 설치 후, JupyterLab 재실행 📌 산점도산점도 생성: plotly 패키지 express 모듈의 scatter(data_frame = 데이터프레임명, ..

9. 지도 시각화(folium 패키지)

9. 지도 시각화(folium 패키지)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 지도 시각화 준비folium 패키지 설치: 아나콘다 프롬프트에 pip install folium 작성 📌 시군구별 인구 단계 구분도시군구 경계 지도 데이터 불러오기open(): 파일 열기load(): 내용 불러오기import json# 시군구 경계 지도 데이터 불러오기geo = json.load(open('SIG.geojson', encoding = 'UTF-8'))"""1. geojson: 위치 정보를 json 포맷으로 저장한 표준 지리 정보 데이터 포맷2. SIG.geojson 파일 구조: 'features' 값에 각각의 시군구 정보가 딕셔너리 형태로 각각의 리..

8. 텍스트 마이닝(konlpy 패키지)

8. 텍스트 마이닝(konlpy 패키지)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 텍스트 마이닝 준비KoNLPy 패키지 설치하기 전java 설치: http://abit.ly/easypy_101에서 운영체제 버전에 맞는 msi 파일 다운로드jpype1 패키지 설치: 아나콘다 프롬프트에 pip install jpype1 작성KoNLPy 패키지 설치: 아나콘다 프롬프트에 pip install konlpy 작성KoNLPy 패키지: 한글 텍스트로 형태소를 분석할 수 있게 해주는 패키지 📌 대통령 연설문 텍스트 마이닝연설문 불러오기open(): 파일 열기encoding: 컴퓨터는 사용자가 지정한 인코딩 방식을 통해 파일의 문자를 숫자로 저장한다. 따라서 이..

7-2. 한국복지패널 데이터 분석(2)

7-2. 한국복지패널 데이터 분석(2)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 직업별 월급 차이월급 변수 검토 및 전처리https://youngchae00.tistory.com/8 '성별에 따른 월급 차이 분석'에서 진행 직업 변수 검토 및 전처리# 타입 확인welfare['code_job'].dtypes# 값 특징 및 이상치 확인welfare['code_job'].value_counts()# 4자리로 구성된 직종코드에서 4자리를 초과하거나 모름/무응답에 해당하는 9999 존재 확인# 존재한다면 결측 처리 필요# 불필요한 검색 과정을 방지하기 위해, 결측을 처리한 후 다른 데이터프레임과 결합하는 순서 추천welfare['code_job'].max(..

7-1. 한국복지패널 데이터 분석(1)

7-1. 한국복지패널 데이터 분석(1)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 데이터 분석 준비2020년에 발간된 한국복지패널 데이터 다운로드아나콘다 프롬프트에 pip install pyreadstat 명령어를 입력하여 pyreadstat 패키지 설치pyreadstat 패키지: pandas 패키지로 통계 분석 소프트웨어(SPSS, SAS, STAT 등)의 데이터 파일을 불러올 수 있도록 하는 패키지pyreadstat 패키지 설치가 필요한 이유: 한국복지패널 데이터는 통계 분석 소프트웨어인 SPSS 전용 파일데이터를 불러온 후, 코드북을 참고하여 변수명을 변경코드북: 데이터의 특징을 설명해 놓은 자료로, 코드로 된 변수명과 값의 의미가 설명되어 있음..

6. 데이터 시각화(seaborn 패키지)

6. 데이터 시각화(seaborn 패키지)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 산점도산점도: 연속값으로 된 두 변수의 관계를 표현할 때 사용하며, seaborn 패키지의 scatterplot(data = 데이터 프레임명, x = 'x축 변수명', y = 'y축 변수명') 함수 활용 파일 불러오기: read_csv('파일경로') 함수 활용import seaborn as snsimport pandas as pdmpg = pd.read_csv('mpg.csv') 산점도 생성sns.scatterplot(data = mpg, x = 'displ', y = 'hwy') 범위 제한: set(xlim = (시작, 끝), ylim = (시작, 끝)) 함수를 활용하..

5. 데이터 정제(결측치, 이상치)

5. 데이터 정제(결측치, 이상치)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 결측치(누락된 값) 정제결측치 찾기: pandas 패키지의 isna(데이터 프레임명) 함수 활용isna() 결과 True: 결측치인 값isna() 결과 False: 결측치가 아닌 값import pandas as pdimport numpy as np # np.nan을 통해 임의로 결측치를 만들기 위함df = pd.DataFrame({'sex': ['M', 'F', np.nan, 'M', 'F'],'score': [5, 4, 3, 4, np.nan]})df# 전체 테이블의 결측치 여부 확인pd.isna(df)# 일부 변수 열의 결측치 여부 확인# df[['sex']].isn..

4. 데이터 가공(전처리)

4. 데이터 가공(전처리)

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 조건에 맞는 데이터 추출실습 데이터 불러오기import pandas as pdexam = pd.read_csv('exam.csv') 조건에 맞는 행 추출: 데이터프레임의 query('조건') 함수 활용exam.query('nclass == 1') # 1반에 해당하는 행 추출# exam.query('nclass != 1'): 1반에 해당하지 않는 행 추출 여러 조건을 충족하는 행 추출: &(그리고) 연산자 활용exam.query('nclass == 1 & math >= 50') # 1반이면서 math가 50점 이상인 행 추출 여러 조건 중 하나 이상 충족하는 행 추출: |..

3. 데이터 파악 및 수정

3. 데이터 파악 및 수정

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑) 📌 데이터 파악read_csv('파일 경로'): 실습 데이터 불러오기import pandas as pd # pandas 패키지 로드# 실습 데이터: 미국 환경 보호국에서 공개한 1999~2008년 미국에 출시된 자동차 234종 정보mpg = pd.read_csv('mpg.csv') # 실습 데이터 → 데이터 프레임mpg 데이터변수명내용manufacturer제조 회사model자동차 모델명displ배기량(displacement)year생산연도cyl실린더 개수(cylinders)trans변속기 종류(transmission)drv구동 방식(drive wheel)cty도시 연비(c..