2. DataFrame

🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑)

 

 

📌 데이터 프레임


성별 연령 학점 연봉
남자 26 3.8 2,700만원
여자 42 4.2 4,000만원
남자 35 2.6 3,500만원
  • 데이터 프레임: 행과 열로 구성된 사각형 모양의 표
      • 속성을 의미하며, 컬럼(column) 또는 변수라고 불림
      • 데이터 분석에서 열이 많다면, 여러 변수의 영향을 동시에 고려할 수 있음
    • 행: 하나의 단위(ex. 한 사람, 하나의 도시 등등)를 의미하며, 로(row) 또는 케이스(case)라고 불림
  • 데이터 분석 Tip: 단순 집계보다 조건과 현상의 관계를 파악하는 것이 더 중요 ι(`・-・´)/
    • 단순 집계
      • ex) 신용카드 결제 내역 분석 결과, 치킨을 가장 많이 사먹는다.
      • ex) 전국 교통사고 데이터를 분석한 결과, 서울에서 교통사고가 가장 자주 발생한다.
    • 조건과 현상의 관계
      • ex) 특정 날씨에 어떤 음식이 더 많이 팔린다.
      • ex) 어떤 모양의 도로에서 교통사고가 자주 발생한다.

 

  • 데이터프레임 생성: pandas(데이터를 가공할 때 사용) 패키지의 DataFrame() 함수 활용
import pandas as pd # pandas 패키지 로드

# 데이터 프레임 만들기
df = pd.DataFrame({'name': ['김지훈', '이유진', '박동현', '김민지'],
'english': [90, 80, 60, 70], 
'math': [50, 60, 100, 20]})

df

 

 

 

📌 엑셀 파일 이용


  • 엑셀 파일 불러오기: pandas 패키지의 read_excel('파일 경로') 함수를 활용하여 데이터프레임으로 생성
import pandas as pd

df_exam = pd.read_excel('excel_exam.xlsx')
df_exam

 

  • excel 파일의 첫 번째 행이 변수가 아닌 경우: read_excel() 함수에서 header = None 설정 → 변수명 0부터 숫자로 자동 지정
df_exam2 = pd.read_excel('excel_exam_novar.xlsx', header = None)
df_exam2

 

  • 엑셀 파일에 시트가 여러개 있는 경우
    • sheet_name = '시트 이름' 작성
    • sheet_name = 몇 번째 시트인지 숫자(0번부터 시작) 작성
df_exam = pd.read_excel('excel_exam.xlsx', sheet_name = 'Sheet2')
df_exam = pd.read_excel('excel_exam.xlsx', sheet_name = 2)

 

 

 

📌 CSV 파일 이용


  • CSV 파일
    • 데이터를 다루는 대부분의 프로그램(엑셀, R, SAS, SPSS 등)에서 읽고 쓸 수 있는 범용 데이터 파일
    • 값이 쉼표로 구분된 형태

 

  • CSV 파일 불러오기: pandas 패키지의 read_csv('파일 경로') 함수를 활용하여 데이터프레임으로 생성
import pandas as pd

df_exam_csv = pd.read_csv('exam.csv')
df_exam_csv

 

  • 데이터 프레임 CSV 파일로 저장하는 방법: 데이터프레임의 to_csv('파일명', index = False) 함수 활용
df_midterm = pd.DataFrame({'english': [90, 80, 60, 70],
'math': [50, 60, 100, 20],
'nclass': [1, 1, 2, 2]})

# to_csv('파일 경로'): 데이터 프레임을 CSV 파일로 만드는 함수
# df_midterm.to_csv('output_newdata.csv') # 첫 번째 열에 인덱스 번호 삽입
df_midterm.to_csv('output_newdata.csv', index = False) # 인덱스 번호 제외 저장