JHJ
[내일배움캠프 QAQC 부트캠프]VS Code와 데이터(14일차, 260529) 본문
1. 오늘 학습 키워드:
VS Code와 데이터

2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

데이터 레벨업! 전처리 & 시각화 세션
2회차
코드 앞의 ! ---> 터미널에서 실행해줘
판다스 - 2차원 데이터(데이터프레임)을 자주 사용
| 관련 코드 pd.series() : 시리즈 생성(1차원) pd.dataframe() : 데이터프레임 생성(2차원) df.shape : 데이터 크기 반환 df.columns: 컬럼명 df.index: 인덱스명 df.dtypes: 데이터타입 활용 df.columns = [] : 리스트로 컬럼명 변경 df.rename(columns={'A': 'B'}, inplace=True): A를 B로 이름변경 |
| 데이터 호출하기 df = pd.read_csv('경로/파일명.csv') 경로 절대경로: (내 PC 기준) 해당 파일이 어느 위치에 있는지 ex) /Users/username/Desktop/SPC Data.csv 상대경로: (이 파이썬 파일이 실행되는 폴더 기준) 해당 파일이 어느 위치에 있는지 ex) ./SPC Data.csv 팀프로젝트 시, 상대경로로 쓰는게 적절 그 외에 url, clipboard로도 데이터 호출 가능 data_A.head() 첫 5행 data_A.tail() 마지막 5행 data_A.info() 전체적 정보(결측치 확인 등등) data_A.describe() 기본 통계 정보 |
|
매서드
예시: 데이터 조회, 선택, 조작, 처리 등등 여러 컬럼 선택시 '리스트' 형태로 ex) basic_info = titanic[['Name', 'Age', 'Sex']] loc: 라벨 기반 ex) titanic.loc[0] 0번 인덱스 iloc: 위치 기반 ex) titanic.iloc[0] 첫번째 행 ex2) titanic.iloc[0:5, [3, 4, 5]] 0~4 인덱스의 3, 4, 5번째 컬럼 | : or 조건 &: and 조건 .isin() 로 해당되는 데이터만 볼 수 있음 first_second_class = titanic[titanic['Pclass'].isin([1, 2])] #1등석 또는 2등석 승객 .notna()로 Null이 아닌 데이터만 볼 수 있음 age_not_null = titanic[titanic['Age'].notna()] # 나이 정보가 있는 승객만 선택 .reset_index() 로 인덱스 리셋 가능(새 인덱스 부여) .set_index(A) A컬럼을 인덱스로 사용 A[c] = A[a] + A[b]: 기존 데이터(a,b)를 기반으로 새 컬럼(c) 생성 가능 .value_counts(): 컬럼의 value 별로 카운팅 .sort_values(컬럼명, ascending=true/false) : 컬럼에 따라 정렬, =true 면 오름차순 |

데이터 전처리&시각화
| 2강 데이터 전처리: 원하는 데이터를 보기 위해 하는 모든 활동 데이터는 정형과 비정형이 존재 --> 주로 정형 데이터를 다룰 것 표 상에서 같은 내용이지만 기록이 다르게 되는 경우도 존재 --> 규칙성에 따라 데이터를 통일하는 것이 필요(전처리의 필요성) 데이터 전처리: 데이터 전달의 '목적성'과 '효과성'를 지녀야 함 Excel vs Pandas: Pandas의 장점 1. 자동화와 프로그래밍 기능 2. 대용량 데이터 처리 3. 복잡한 데이터 처리 및 분석 4. 확장성과 유연성 5. 버전 관리 Pandas 구조 인덱스: 항목 식별용 목록 시리즈: 1차원 배열, 1개의 컬럼 데이터프레임: 2차원 배열, 2개 이상의 컬럼 |
| 3강 ctrl + shift + ~ : 터미널 열기 pip install: pip 설치 데이터 저장 pd.to_csv(’파일경로/파일명.csv’ , index = False) pd.to_excel(’파일경로/파일명.xlsx’ , index = False) (예시)data_A.to_csv('./newfile.csv', index = False) csv 파일로 인덱스 없이 data_A 저장 데이터 읽기 (예시)A=pd.read_csv("tips_data.csv") 인덱스 디폴트: 0부터 시작 df.index = [] 로 별도로 지정가능 df.loc('인덱스명') 인덱스에 대응하는 데이터 가져오기 df.sort_index() 정렬 df.set_index('A') A를 인덱스로 사용 df.reset_index() 원래의 정수값 추가 df.reset_index(drop=true) 원래의 정수값으로 회귀(그 외에 인덱스 제거) To be continued... |
3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: 코드카타 중 for 문을 너무 자주 사용하게 된다.(오늘은 3중 for문까지 나왔다)
썩 보기 좋은 코드는 아니었다. 제출 후에 타인의 우수 답변을 보면서 피드백을 얻고 있다.
3-2 회고: 파이썬을 활용한 데이터 분석. 체득만 된다면 이젠 확실히 할 수 있다.
4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)
- 주말(30,31일): 강의(전처리/시각화 2강), 어학
- 월요일(1일): 강의(전처리/시각화 3강), 컴퓨터활용능력 - 엑셀

'[내일배움캠프 QAQC 부트캠프] > TIL' 카테고리의 다른 글
| [내일배움캠프 QAQC 부트캠프]VS Code와 시각화(16일차, 260602) (0) | 2026.06.02 |
|---|---|
| [내일배움캠프 QAQC 부트캠프]VS Code와 데이터2(15일차, 260601) (0) | 2026.06.01 |
| [내일배움캠프 QAQC 부트캠프]VS Code 맛보기(13일차, 260528) (0) | 2026.05.28 |
| [내일배움캠프 QAQC 부트캠프]컨디션 난조(12일차, 260527) (0) | 2026.05.27 |
| [내일배움캠프 QAQC 부트캠프]쉬엄쉬엄 걷기(11일차, 260526) (0) | 2026.05.26 |
