JHJ
[내일배움캠프 QAQC 부트캠프]종합공부세트(17일차, 260604) 본문
1. 오늘 학습 키워드:
종합공부세트(ADsP, 시각화/라이브러리, 어학공부)

2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

ADSP 자격증 챌린지
2강
| 빅데이터: 일반적인 데이터베이스 소프트웨어로 저장, 관리, 분석할 수 있는 범위를 초과하는 규모의 데이터 빅데이터 3V - 가트너그룹(Gartner Group)의 더그래니(Doug Laney) 데이터의 양(Volume), 다양성(Variety), 속도(Velocity) 빅데이터 4V 더그 래니의 3V + Value(가치) 또는 veracity(정확성) + Visualization(시각화), Variability(가변성) 등. 출현 배경 산업계: 고객 데이터 축적 + '양질 전환 법칙': 양적인 변화가 축적되면 질적인 변화 학계: 거대 데이터 활용 + '과학 확산': 기술 아키텍처 및 통계 도구들의 지속적 발전 기술발전: 관련 기술의 발달 ~ 저장 기술의 발전과 가격 하락(저장 단위당 )' + '클라우드 컴퓨팅' 빅데이터의 기능 1. 빅데이터는 ‘산업혁명의 석탄, 철’ ~ 혁명적 변화 2. 빅데이터는 ‘21세기의 원유’ ~ 새로운 범주의 산업 3. 빅데이터는 ‘렌즈’ ~ 현미경-생물학 발전처럼 4. 빅데이터는 ‘플랫폼’ ~ 공동 활용의 목적 데이터가 만들어내는 변화 1. 사전처리 → 사후처리 2. 표본조사 → 전수조사 3. 질 → 양 4. 인과관계 → 상관관계 빅데이터 가치 산정이 어려운 이유 1. 데이터 활용 방식 2. 새로운 가치 창출 3. 분석 기술의 발전 빅데이터가 미치는 영향 : 생활 전반의 스마트화(기업, 정부, 개인) |
| 빅데이터 활용 기본 테크닉 7가지(와 핵심키워드) 1. 연관규칙 학습: 상관관계 2. 유형분석: 범주/분류 3. 유전 알고리즘: 최적화 4. 기계학습: '훈련 데이터, 특성, 예측, ex.딥러닝 5. 회귀분석: 원인과 결과 6. 감정분석: 감정 7. 소셜 네트워크 분석: 사회관계망 분석, 관계 |
| 위기요인 1. 사생활 침해: '개인정보가 포함된 데이터' 2. 책임 원칙 훼손: 예측 알고리즘의 희생양, 가능성이 높다는 이유 - 책임 - 민주주의 사회 원칙을 크게 훼손 3. 데이터 오용: 과신, 잘못된 지표, 잘못된 인사이트 통제방안 1. 사생활 침해의 통제 방안 → ‘동의에서 책임으로’ 2. 책임 원칙 훼손의 통제 방안 → ‘결과 기반 책임 원칙 고수’ 3. 데이터 오용의 위기요소에 대한 대응책 → ‘알고리즘 접근권 허용/인증’ + 불이익을 당한 사람들을 대변할 전문가 알고리즈미스트(Algorithmist)가 필요 빅데이터 활용의 3요소: 데이터, 기술, 인력 개인정보 비식별 기술: 데이터 마스킹, 가명처리, 총계처리, 데이터값 삭제, 데이터 범주화 |
| 빅데이터 열풍과 회의론: 과거 CRM의 부정적 학습효과, 과대 포장 빅데이터 분석: 1. 크기가 아닌 ‘인사이트’ 2. 전략적 인사이트의 중요성 산업별 일차원적인 분석: '트레이딩'은 '에너지' 산업! '프로그램 트레이딩'은 '금융 서비스' 산업! 일차원적 분석: 업계 내부의 문제에만 포커스, 부서 단위로 관리되기 때문에 비즈니스 성공에 핵심적인 역할을 기대X --> 활용 범위를 더 넓고 전략적으로 변화시킴으로써 전략적 인사이트를 주는 가치 기반 분석 단계 데이터 사이언스: 데이터로부터 의미 있는 정보를 추출해내는 학문 통계학: '정형화된 실험 데이터' vs 데이터 사이언스: '다양한 유형의 데이터' 데이터 사이언티스트의 역량: 분석 영역, IT 영역, 비즈니스 관점 하드 스킬: 빅데이터 지식, 기술 숙련 등 소프트 스킬: 통찰력, 소통 등 가트너 제시 역량: 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬 데이터 사이언스: 소프트 스킬은 인문학과 관련: '과학과 인문의 교차로' 인문학적 사고: 과거- 현재 -미래 가치 패러다임의 변화: 디지털화(과거) - 연결(현재) - 에이전시(미래) |

데이터 레벨업! 전처리 & 시각화 세션
5회차
| seaborn (as sns) 라이브러리: pandas dataframe과의 연동 우수 1. 간결한 코드 2. 통계 시각화 기능 제공 3. pandas와의 호환성 高 4. 다양한 시각적 스타일 제공 sns.barplot(data=data_a, x="A", y="B") 바플롯 외에 boxplot, violinplot, swarmplot, lineplot, histplot 등등 산점도(scatterplot) 에 옵션 부여도 가능 hue=A A에 따른 색 다르게 style=B B에 따른 모양 다르게 size=C C에 따른 점 크기 다르게 sizes=(20,200) 점 크기 범위 빈도그래프(countplot) : 알아서 개수를 세줌 히트맵(heatmap): matplotlib 보단 seaborn 사용 pairplot: 모든 수치형 변수의 관계를 보여줌 색상의 선택 발표자료 색상 발표와 어울리는 색으로 (즉, 푸른 떡볶이처럼 만들지 않기) 강조하고자 하는 것에 진한 색 Matplotlib 에서 여러 그래프를 그리려면 subplot 사용해야 함 But, Seaborn과 Plotly는 Faceting 기능(그래프 쪼개기): Col 옵션 회귀선(추세선)이 있는 산점도: lmplot 히스토그램과 산점도를 동시에 보는: jointplot 겹치지 않는 산점도(적은 데이터양): swarmplot |
| Plotly 라이브러리 마우스 오버가 가능(-> 웹페이지나 대시보드에서 사용자와 상호작용 가능) sunbrust 차트: 한정된 공간에 많은 필터를 보여줘야 할 때 애니매이션 차트: 슬라이드처럼 보여주는 기능 ydata-profiling 라이브러리 pip install ydata-profiling 가장 유명한 EDA 자동화 라이브러리1 Sweetviz 라이브러리 pip install sweetviz EDA 자동화 라이브러리2 pygwalker 라이브러리 |
3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: 코드카타 중 채점 단계에서 시간 초과로 인한 실패 -
| 문제의 코드: 59번 덧칠하기(https://school.programmers.co.kr/learn/courses/30/lessons/161989) |
| # 실패한 코드 def solution(n, m, section): # n미터인 벽, 롤러의 길이는 m미터, 1미터 n개로 벽을 나누고 롤러가 벽을 벗어나면 안 됨 result = 0 while len(section) > 0: result += 1 start = section[0] for i in range(m): j = start + i if j in section: section.remove(j) return result |
| # 수정한 방법: <if in문 + section.remove() >문 대신 다른 방법 차용 def solution(n, m, section): result = 0 last = 0 for i in section: if i > last: result += 1 last = i+m-1 return result |
3-2 회고: 슬슬 아침 코드카타가 너무 벅차다
4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)
- 금요일(5일): 할당된 강의(없으면 ADsP 강의), 어학

'[내일배움캠프 QAQC 부트캠프] > TIL' 카테고리의 다른 글
| [내일배움캠프 QAQC 부트캠프]기초 프로젝트 발제(19일차, 260608) (0) | 2026.06.08 |
|---|---|
| [내일배움캠프 QAQC 부트캠프]라스트 스퍼트(18일차, 260605) (0) | 2026.06.05 |
| [내일배움캠프 QAQC 부트캠프]VS Code와 시각화(16일차, 260602) (0) | 2026.06.02 |
| [내일배움캠프 QAQC 부트캠프]VS Code와 데이터2(15일차, 260601) (0) | 2026.06.01 |
| [내일배움캠프 QAQC 부트캠프]VS Code와 데이터(14일차, 260529) (0) | 2026.05.29 |
