2. DataFrame
🔗 'Do it! 쉽게 배우는 파이썬 데이터 분석' 책을 기반으로 JupyterLab 환경에서 학습한 내용입니다 _φ(๑╹╹๑)
📌 데이터 프레임
| 성별 | 연령 | 학점 | 연봉 |
| 남자 | 26 | 3.8 | 2,700만원 |
| 여자 | 42 | 4.2 | 4,000만원 |
| 남자 | 35 | 2.6 | 3,500만원 |
- 데이터 프레임: 행과 열로 구성된 사각형 모양의 표
- 열
- 속성을 의미하며, 컬럼(column) 또는 변수라고 불림
- 데이터 분석에서 열이 많다면, 여러 변수의 영향을 동시에 고려할 수 있음
- 행: 하나의 단위(ex. 한 사람, 하나의 도시 등등)를 의미하며, 로(row) 또는 케이스(case)라고 불림
- 열
- 데이터 분석 Tip: 단순 집계보다 조건과 현상의 관계를 파악하는 것이 더 중요 ι(`・-・´)/
- 단순 집계
- ex) 신용카드 결제 내역 분석 결과, 치킨을 가장 많이 사먹는다.
- ex) 전국 교통사고 데이터를 분석한 결과, 서울에서 교통사고가 가장 자주 발생한다.
- 조건과 현상의 관계
- ex) 특정 날씨에 어떤 음식이 더 많이 팔린다.
- ex) 어떤 모양의 도로에서 교통사고가 자주 발생한다.
- 단순 집계
- 데이터프레임 생성: pandas(데이터를 가공할 때 사용) 패키지의 DataFrame() 함수 활용
import pandas as pd # pandas 패키지 로드
# 데이터 프레임 만들기
df = pd.DataFrame({'name': ['김지훈', '이유진', '박동현', '김민지'],
'english': [90, 80, 60, 70],
'math': [50, 60, 100, 20]})
df

📌 엑셀 파일 이용
- 엑셀 파일 불러오기: pandas 패키지의 read_excel('파일 경로') 함수를 활용하여 데이터프레임으로 생성
import pandas as pd
df_exam = pd.read_excel('excel_exam.xlsx')
df_exam

- excel 파일의 첫 번째 행이 변수가 아닌 경우: read_excel() 함수에서 header = None 설정 → 변수명 0부터 숫자로 자동 지정
df_exam2 = pd.read_excel('excel_exam_novar.xlsx', header = None)
df_exam2

- 엑셀 파일에 시트가 여러개 있는 경우
- sheet_name = '시트 이름' 작성
- sheet_name = 몇 번째 시트인지 숫자(0번부터 시작) 작성
df_exam = pd.read_excel('excel_exam.xlsx', sheet_name = 'Sheet2')
df_exam = pd.read_excel('excel_exam.xlsx', sheet_name = 2)
📌 CSV 파일 이용
- CSV 파일
- 데이터를 다루는 대부분의 프로그램(엑셀, R, SAS, SPSS 등)에서 읽고 쓸 수 있는 범용 데이터 파일
- 값이 쉼표로 구분된 형태
- CSV 파일 불러오기: pandas 패키지의 read_csv('파일 경로') 함수를 활용하여 데이터프레임으로 생성
import pandas as pd
df_exam_csv = pd.read_csv('exam.csv')
df_exam_csv

- 데이터 프레임 CSV 파일로 저장하는 방법: 데이터프레임의 to_csv('파일명', index = False) 함수 활용
df_midterm = pd.DataFrame({'english': [90, 80, 60, 70],
'math': [50, 60, 100, 20],
'nclass': [1, 1, 2, 2]})
# to_csv('파일 경로'): 데이터 프레임을 CSV 파일로 만드는 함수
# df_midterm.to_csv('output_newdata.csv') # 첫 번째 열에 인덱스 번호 삽입
df_midterm.to_csv('output_newdata.csv', index = False) # 인덱스 번호 제외 저장

'데이터 분석 > Python' 카테고리의 다른 글
| 6. 데이터 시각화(seaborn 패키지) (0) | 2026.07.20 |
|---|---|
| 5. 데이터 정제(결측치, 이상치) (0) | 2026.07.17 |
| 4. 데이터 가공(전처리) (0) | 2026.07.16 |
| 3. 데이터 파악 및 수정 (0) | 2026.07.15 |
| 1. 변수, 함수, 모듈, 패키지 (0) | 2026.07.13 |