JHJ

[내일배움캠프 QAQC 부트캠프]라스트 스퍼트(18일차, 260605) 본문

[내일배움캠프 QAQC 부트캠프]/TIL

[내일배움캠프 QAQC 부트캠프]라스트 스퍼트(18일차, 260605)

Jo, Hongjin 2026. 6. 5. 14:59

1. 오늘 학습 키워드:

ADsP, 시각화/라이브러리, 어학공부


MBC 무한도전 -어느 멋진날 中

2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

AI로 생성된 이미지

 

ADSP 자격증 챌린지

3강 데이터 분석 기획

4가지 분석 주제: 
분석의 대상/ 방법을 아냐/모르냐에 따라 달라짐
해결해야 할 문제, 분석 대상이 무엇인지 알고 분석 방법도 알고 있다면 ‘최적화’
분석 대상이 무엇인지 알고 있지만 방법을 모른다면 ‘솔루션’
분석 대상이 무엇인지 모르고 분석 방법도 모른다면, 분석 대상 자체를 새롭게 도출하는 ‘발견’
분석 대상이 무엇인지 모르지만 분석 방법은 알고 있다면 ‘통찰력’

당면한 분석 주제의 해결 (과제 단위):
Speed & Test , Quick & Win, Problem Solving(단기적)
지속적 분석 문화 내재화:(마스터 플랜 단위):
Accuracy & Deploy, Long Term View, Problem Definition(중장기적)

분석기획 고려사항 3가지

1. 가용 데이터 고려
2. 적절한 활용방안과 유스케이스의 탐색
3. 장애요소에 대한 사전 계획 수립

 분석 방법론 : 상세한 절차, 방법, 도구와 기법,  템플릿과 산출물


기업의 합리적인 의사결정 방해요소 3가지: 1. 고정 관념, 2. 편향된 생각, 3. 프레이밍 효과 : 한 사건이나 상황을 두고 개인의 판단이나 선택이 달라질 수 있는 현상

암묵지 - 방법론 - 형식지: 내재화, 형식화, 체계화를 통해 상호전환

(분석방법론 중)업무 특성에 따른 모델
1. 폭포수 모델
2. 프로토타입 모델
3. 나선형 모델
4. 계층적 프로세스 모델
KDD 분석 방법론: 데이터로부터 통계적 패턴이나 지식을 찾기 위해 활용할 수 있도록 체계적으로 정리한 데이터 마이닝 프로세스
1단계 데이터셋 선택: 타깃 데이터 생성(비즈니스 도메인에 대한 이해와 프로젝트 목표 설정 필수)
2단계 데이터 전처리: 잡음, 이상치, 결측치를 파악하여 제거, 의미 있는 데이터로 재가공
3단계 데이터 변환 : 정제된 데이터에 분석 목적에 맞게 변수를 생성, 선택하고 데이터의 차원을 축소, 데이터마이닝 프로세스 진행을 위해 데이터셋 변경
4단계 데이터 마이닝: 데이터 마이닝 기법을 선택. 데이터마이닝 작업을 실행
5단계 해석과 평가: 해석과 평가, 일치성 확인, 활용방안

CRISP-DM 분석 방법: 조금 더 세분화되어 있다는 것이 차이점, 각 단계는 단방향으로 구성되어 있지 않고 '단계 간 피드백(업무 이해-데이터 이해 또는 데이터 준비-모델링)'을 통하여 단계별 완성도를 높이게 구성
1단계 업무 이해
2단계 데이터 이해 
3단계 데이터 준비
4단계 모델링
5단계 평가
6단계 전개 
빅데이터 분석 방법론 3계층 : 5단계(5단계), 태스크, 스텝(단위 프로세스)
빅데이터 분석 방법론 5단계 플로우:
1. 분석 기획 :  비즈니스 이해 및 범위 설정 (비즈니스 이해, 프로젝트 범위 설정, SOW), 프로젝트 정의 및 계획 수립(데이터 분석 프로젝트 정의, 프로젝트 수행 계획 수립, WBS) , 프로젝트 위험계획 수립(위험의 우선순위, 위험에 대해 회피, 전이, 완화, 수용으로 구분)
2. 데이터 준비 :  필요 데이터 정의(데이터 정의 등), 데이터 스토어 설계, 데이터 수집 및 정합성 점검
3. 데이터 분석: 분석용 데이터 준비(스토어로부터 필요 데이터 추출), 텍스트 분석, 탐색적 분석(EDA, 시각화), : 모델링(데이터 분할: 과적합 방지를 위한 분할, 데이터 모델링, 모델 적용 및 운영 방안: 알고리즘 설명서), 모델 평가 및 검증
4. 시스템 구현(반드시X 필요시O) : 시범 및 구현
5. 평가 및 전개: 모델 발전 계획 수립, 평가 및 보고(최종보고서)

분석 과제: 풀어야 할 다양한 문제를 데이터 분석 문제로 변환한 후 이해관계자들이 이해하고 프로젝트로 수행할 수 있는 과제 정의서 형태로 도출, 하향식 접근 방법(문제가 주어진 상태)과 상향식 접근 방법(문제를 모르는 상태) -->최적의 의사결정은 두 접근 방식이 상호 보완 관계
하향식 접근법
1단계 : 문제 탐색 단계
2단계 : 문제 정의 단계
3단계 : 해결 방안 탐색 단계
4단계 : 타당성 검토 단계

상향식 접근법
먼저 분석을 시작하고 그 결과로부터 가치가 있는 문제를 도출
디자인 사고: 공감(강조), 정의, 아이디어, 프로토타입, 테스트 // 첫 단계로 감정이입(Empathize)을 특히 강조

지도학습과 비지도 학습
지도 학습: 정답이 있는 데이터를 활용하여 분석 모델을 학습
비지도 학습: 답을 알려주지 않고 학습하는 것
일반적으로 상향식 접근방식의 데이터 분석은 비지도학습에 의해 수행

시행착오를 통한 문제 해결 (프로토타이핑 접근법): 상향식, 결과를 확인해 가면서 반복적으로 개선


분석 과제의 5가지 주요 속성
데이터의 양
데이터 복잡도
분석의 속도
분석 복잡도
정확도 & 정밀도: '정확도'는 '모델과 실제 값 간의 차이'가 적다는 정확도를 의미하고, 정밀도는 반복적으로 모델을 사용했을 때 '모델 값들의 편차' 수준

분석 과제 관리 방안
시간:  Time Boxing 기법: 현재 할당된 작업이 주어진 시간 동안 완수되지 못하였더라도 다음 작업으로 넘어가는 방법

 

AI로 생성된 이미지

 



 

데이터 레벨업! 전처리 & 시각화 세션
6회차 복습
pip

pip은 팀적으로 버전을 맞추는 데에 중요
터미널에서
pip install ~
pip list 
prp freeze > requirements.txt
deactivate 등
Numpy

행, 열, 채널
3차원까지 표현(ndim으로 확인)
size dtype shape 등등
.arrage() 배열
.random 기능
.reshape
[ ] 슬라이싱
블리언 인덱싱도 됨

pandas

시리즈, 데이터프레임
데이터 불러오기(read csv, excel), 데이터 탐색(head, info, describe)
다양한 메서드
데이터 선택(컬럼 선택/반환)
loc/iloc : 라벨/위치 기반
조건 필터링(&, |, isin, notna)
인덱스(reset_index, set_index)
EDA

수치형 데이터
범주형 데이터
분포
상관관계 corr ,heatmap
결측치 isnull, isna, notna
결측치 제거, 대체, 고급처리 등등

데이터 타입 변환

 astype 데이터 변경
 pd.to_numeric 수치형 변환(안되면 예외처리)
날짜 데이터, 날짜 기반 분석

데이터 병합
concat , merge
matplotlib

plot 그래프 그리기
색상 마커 스타일 등등 설정가능
그래프 종류 다양하게 가능
막대그래프, 산점도, 히스토그램, 선그래프, 파이차트, 박스플롯, 바이올릿플롯 등


seaborn & plotly & EDA 자동화

seaborn 시각화 라이브러리 고급
산점도, countplot, barplot, boxplot, violinplot, heatmap, pairplot, jointplot 등
plotly 시각화 라이브러리, 마우스오버 가능
상호작용 가능한 산점도, 트리맵, 애니매이션 플롯 등
EDA 자동화: YDATA profiling, Sweetviz, PyGwalker 

3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: X

3-2 회고: 라이브 세션 중 퀴즈, 천천히 풀었으면 한개 빼곤 다 맞았겠다 싶다...


4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)

- 주말(6,7일): 영어 스피킹 준비

- 월요일(8일): 할당된 강의(없으면 ADsP 강의), 어학

 

 

AI 시대를 돌파할 취업 솔루션 | 내일배움캠프

직무별 AI 활용 역량부터 인턴십까지. AI 시대를 돌파할 취업 솔루션, 스파르타클럽 내일배움캠프

nbcamp.spartaclub.kr