JHJ

[내일배움캠프 QAQC 부트캠프]VS Code와 데이터(14일차, 260529) 본문

[내일배움캠프 QAQC 부트캠프]/TIL

[내일배움캠프 QAQC 부트캠프]VS Code와 데이터(14일차, 260529)

Jo, Hongjin 2026. 5. 29. 17:23

1. 오늘 학습 키워드:

VS Code와 데이터

 

김성모 만화 패러디 원본: https://gall.dcinside.com/mgallery/board/view/?id=lostvikings&no=436536

 



2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

AI로 생성된 이미지

데이터 레벨업! 전처리 & 시각화 세션

2회차

코드 앞의 ! ---> 터미널에서 실행해줘
판다스 - 2차원 데이터(데이터프레임)을 자주 사용

관련 코드
pd.series() : 시리즈 생성(1차원)
pd.dataframe() : 데이터프레임 생성(2차원)
df.shape : 데이터 크기 반환
df.columns: 컬럼명
df.index: 인덱스명
df.dtypes: 데이터타입

활용
df.columns = [] : 리스트로 컬럼명 변경
df.rename(columns={'A': 'B'}, inplace=True): A를 B로 이름변경
데이터 호출하기
df = pd.read_csv('경로/파일명.csv')
경로
절대경로: (내 PC 기준) 해당 파일이 어느 위치에 있는지
ex) /Users/username/Desktop/SPC Data.csv
상대경로: (이 파이썬 파일이 실행되는 폴더 기준) 해당 파일이 어느 위치에 있는지
ex) ./SPC Data.csv
팀프로젝트 시, 상대경로로 쓰는게 적절
그 외에 url, clipboard로도 데이터 호출 가능

data_A.head() 첫 5행
data_A.tail() 마지막 5행
data_A.info() 전체적 정보(결측치 확인 등등)
data_A.describe() 기본 통계 정보
매서드
예시: 데이터 조회, 선택, 조작, 처리 등등
여러 컬럼 선택시 '리스트' 형태로
ex) basic_info = titanic[['Name', 'Age', 'Sex']]

loc: 라벨 기반
ex) titanic.loc[0]  0번 인덱스
iloc: 위치 기반
ex) titanic.iloc[0] 첫번째 행
ex2) titanic.iloc[0:5, [3, 4, 5]]   0~4 인덱스의 3, 4, 5번째 컬럼

| : or 조건
&: and 조건

.isin() 로 해당되는 데이터만 볼 수 있음
first_second_class = titanic[titanic['Pclass'].isin([1, 2])]  #1등석 또는 2등석 승객
.notna()로 Null이 아닌 데이터만 볼 수 있음
age_not_null = titanic[titanic['Age'].notna()] # 나이 정보가 있는 승객만 선택

.reset_index() 로 인덱스 리셋 가능(새 인덱스 부여)
.set_index(A) A컬럼을 인덱스로 사용
A[c] = A[a] + A[b]:  기존 데이터(a,b)를 기반으로 새 컬럼(c) 생성 가능
.value_counts(): 컬럼의 value 별로 카운팅
.sort_values(컬럼명, ascending=true/false) : 컬럼에 따라 정렬, =true 면 오름차순
 

 

AI로 생성된 이미지

데이터 전처리&시각화

 

2강
데이터 전처리: 원하는 데이터를 보기 위해 하는 모든 활동

데이터는 정형과 비정형이 존재 --> 주로 정형 데이터를 다룰 것
표 상에서 같은 내용이지만 기록이 다르게 되는 경우도 존재
--> 규칙성에 따라 데이터를 통일하는 것이 필요(전처리의 필요성)

데이터 전처리: 데이터 전달의 '목적성'과 '효과성'를 지녀야 함
Excel vs Pandas: Pandas의 장점
1. 자동화와 프로그래밍 기능
2. 대용량 데이터 처리
3. 복잡한 데이터 처리 및 분석
4. 확장성과 유연성
5. 버전 관리

Pandas 구조
인덱스: 항목 식별용 목록
시리즈: 1차원 배열, 1개의 컬럼
데이터프레임: 2차원 배열, 2개 이상의 컬럼
3강
ctrl + shift + ~ : 터미널 열기
pip install:  pip 설치

데이터 저장
pd.to_csv(’파일경로/파일명.csv’ , index = False)
pd.to_excel(’파일경로/파일명.xlsx’ , index = False)
(예시)data_A.to_csv('./newfile.csv', index = False)
csv 파일로 인덱스 없이 data_A 저장 
데이터 읽기
(예시)A=pd.read_csv("tips_data.csv")

인덱스
디폴트: 0부터 시작
df.index = [] 로 별도로 지정가능
df.loc('인덱스명') 인덱스에 대응하는 데이터 가져오기
df.sort_index() 정렬
df.set_index('A') A를 인덱스로 사용
df.reset_index() 원래의 정수값 추가
df.reset_index(drop=true) 원래의 정수값으로 회귀(그 외에 인덱스 제거)

 

To be continued...

 


3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: 코드카타 중 for 문을 너무 자주 사용하게 된다.(오늘은 3중 for문까지 나왔다)

                             썩 보기 좋은 코드는 아니었다. 제출 후에 타인의 우수 답변을 보면서 피드백을 얻고 있다.

3-2 회고: 파이썬을 활용한 데이터 분석. 체득만 된다면 이젠 확실히 할 수 있다.


4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)

- 주말(30,31일): 강의(전처리/시각화 2강), 어학

- 월요일(1일): 강의(전처리/시각화 3강), 컴퓨터활용능력 - 엑셀