JHJ

[내일배움캠프 QAQC 부트캠프]기초 프로젝트 발제(19일차, 260608) 본문

[내일배움캠프 QAQC 부트캠프]/TIL

[내일배움캠프 QAQC 부트캠프]기초 프로젝트 발제(19일차, 260608)

Jo, Hongjin 2026. 6. 8. 20:16

1. 오늘 학습 키워드:

ADsP, 기초 프로젝트(1일차)



AI/로봇을 표현한 Blutgruppe 작가의 작품

 


2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

AI로 생성된 이미지

 

ADSP 자격증 챌린지

4강 데이터 분석 기획

분석 마스터 플랜 수립 프레임워크
1단계: '우선순위'
다음 단계: '적용 범위' 
최종: 분석 구현의 '로드맵'
우선순위 고려요소: 전략적 중요도, 비즈니스 성과, ROI, 실행 용이성
적용범위 고려요소: 업무 내재화 적용 수준, 분석 데이터 적용 수준, 기술 적용 수준
정보전략계획(ISP): 내/외부 환경을 분석,  시스템 구축 우선순위를 결정
ROI 관점에서 3V는 '투자 비용 측면'의 요소
+ 가치(Value)는 '비즈니스 측면'의 효과
시급성: 전략적 중요도, 목표 가치(KPI)
난이도: 데이터를 생성, 저장, 가공, 분석하는 비용, 분석 수준, 적용 비용 측면과 범위 측면
4분면 부석을 활용한 우선순위 평가 기준: 3분면 기준: 시급성(반시계), 난이도(시계)
분석 거버넌스 체계 수립
거버넌스: 체계적인 관리, 일정한 규칙과 규범
5가지 구성요소:  조직, 과제 기획 및 운영 프로세스, 분석 관련 시스템 , 데이터, 분석 관련 교육 및 마인드 육성 체계
분석 수준 진단 프레임 워크: 분석 준비도, 분석 성숙도
분석 준비도: 기업의 데이터 분석 도입의 수준을 파악하기 위한 진단 방법(분석 업무 파악, 인력 및 조직, 분석 기법, 분석 데이터, 분석 문화, IT 인프라)
분석 성숙도:  3개 부문(비즈니스 부문, 조직 및 역량 부문, IT 부문),  4단계(도입단계, 활용단계, 확산 단계, 최적화 단계)
분석 수준 진단 결과: '분석 준비도', '성숙도' 토대로 기업의 현재 분석 수준을 객관적 파악 - 준비형, 정착형, 도입형, 확산형
데이터 거버넌스: 전사 차원의 모든 데이터에 대해 정책 및 지침, 표준화, 운영 조직 및 책임 등의 표준화된 관리 체계를 수립하고 운영을 위한 프레임워크 및 저장소를 구축하는 것, 관리대상(마스터 데이터, 메타 데이터, 데이터 사전), 구성요소(원칙, 조직, 프로세스)
데이터 거버넌스 체계: 데이터 표준화, 데이터 관리 체계, 데이터 저장소 관리, 표준화 활동
데이터 분석 조직 유형: 집중형 조직 구조, 기능 중심의 조직 구조, 분산된 조직 구조
분석 과제 관리 프로세스 수립: 분석 과제 관리 프로세스(과제 발굴 단계, 과제 수행 단계)
R 언어 : 통계 분석/시각화를 위한 언어
R Studio: R 언어를 더 쉽고 효과적으로 사용할 수 있게 해주는 프로그램
+ 5강은 따로 다룰 예정

6강 데이트 마트, 데이터웨어하우스, 데이터베이스

데이터 마트: 데이터 웨어하우스로부터 특정 사용자가 관심을 갖는 데이터들을 주제별, 부서별로 추출하여 모은 비교적 작은 규모의 데이터 묶음, 시간/공간적인 효율성
데이터 전처리: 데이터 정제하는 과정, 분석 변수를 처리하는 과정
요약변수: 원래 데이터로부터 기본적인 통계 자료를 추출한 데이터 마트에서 가장 기본적인 변수
파생변수: 기본적인 통계자료가 아닌 의미(목적)를 부여한 변수
reshape 패키지, sqldf 패키지, plyr 패키지, data.table 패키지 등의 다양한 패키지
데이터 탐색
탐색적 데이터 분석(EDA): 데이터의 대략적인 특성을 파악하는 것
결측값: 존재하지 않는 데이터, 가능하면 결측값은 제외하고 처리, 다만 결측값 자체가 의미있는 예외의 경우도 있음
결측값 처리를 위한 패키지 : Amelia, DMwR2 등
단순 대치법: 결측값이 존재하는 데이터를 삭제하는 방법, 결측값이 많은 대량의 데이터인 경우 데이터 손실 발생, complete.cases 함수
평균 대치법: 데이터의 평균으로 결측값을 대치
단순 확률 대치법: 평균 대치법 보완, K-Nearest Neighbor(대표적 방법)
다중 대치법: 여러 번의 대치, 가상적 완전 자료
이상치 사용분야: 사기탐지, 부정사용방지 등
이상값 판단 방법: ESD(전체 데이터의 0.3 퍼센트를 이상값으로 구분), 사분위수, IQR(Q1 - 1.5 X IQR (하한 최솟값) 보다 작거나 Q3 + 1.5 X IQR (상한 최댓값)보다 큰 값)

 

출처: https://www.flaticon.com/kr/free-icon/discussion_2833250
기초 프로젝트
주제 선정: 팀원 간 상의를 통해 제공된 팀프로젝트 주제 중 1개 택  
데이터 구성 파악: 선택한 주제의 구성 데이터 확인 및 흐름 파악
역할 분담: 팀장 주도 하에 프로젝트에서 각 팀원이 맡을 역할 할당 및 업무 조율
분석 기획서 작성: 선정한 주제 및 파악한 데이터를 바탕으로 최종 목표와 문제 정의, 데이터 활용 계획 , 프로젝트 기대 효과 등을 구상
 

3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: 데이터의 구성을 확인해봤다.

                            - 문제점1: 결측치랑 이상치를 어디까지/어떻게 전처리 해야 할지

                            - 문제점2: 인과관계까지 도출할 수 있을 것인지

                            - 이 문제들을 해결하기 위해선 일단 내일 진행되는 전처리 및 EDA를 시도해야 한다.

3-2 회고: 데이터 분석을 하고 싶은데 써야 할 게 산더미처럼 많다.


4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)

- 화요일(9일): 팀프로젝트 中 데이터 전처리 및 탐색적 분석(EDA), 어학공부

 

 

AI 시대를 돌파할 취업 솔루션 | 내일배움캠프

직무별 AI 활용 역량부터 인턴십까지. AI 시대를 돌파할 취업 솔루션, 스파르타클럽 내일배움캠프

nbcamp.spartaclub.kr