JHJ

[내일배움캠프 QAQC 부트캠프]종합공부세트(17일차, 260604) 본문

[내일배움캠프 QAQC 부트캠프]/TIL

[내일배움캠프 QAQC 부트캠프]종합공부세트(17일차, 260604)

Jo, Hongjin 2026. 6. 4. 12:12

1. 오늘 학습 키워드:

종합공부세트(ADsP, 시각화/라이브러리, 어학공부)


엄백호군도 보는 토익 - 이말년씨리즈 5화 中

2. 오늘 학습 한 내용을 나만의 언어로 정리하기:

AI로 생성된 이미지



ADSP 자격증 챌린지

2강

빅데이터: 일반적인 데이터베이스 소프트웨어로 저장, 관리, 분석할 수 있는 범위를 초과하는 규모의 데이터

빅데이터 3V - 가트너그룹(Gartner Group)의 더그래니(Doug Laney)
데이터의 양(Volume), 다양성(Variety), 속도(Velocity)
빅데이터 4V
더그 래니의 3V + Value(가치) 또는 veracity(정확성) + Visualization(시각화), Variability(가변성) 등.

출현 배경
산업계: 고객 데이터 축적 + '양질 전환 법칙': 양적인 변화가 축적되면 질적인 변화
학계: 거대 데이터 활용 + '과학 확산': 기술 아키텍처 및 통계 도구들의 지속적 발전
기술발전: 관련 기술의 발달 ~ 저장 기술의 발전과 가격 하락(저장 단위당 )' + '클라우드 컴퓨팅'

빅데이터의 기능
1. 빅데이터는 ‘산업혁명의 석탄, 철’ ~  혁명적 변화
2. 빅데이터는 ‘21세기의 원유’ ~ 새로운 범주의 산업
3. 빅데이터는 ‘렌즈’ ~ 현미경-생물학 발전처럼
4. 빅데이터는 ‘플랫폼’ ~ 공동 활용의 목적

데이터가 만들어내는 변화
1. 사전처리 → 사후처리
2. 표본조사 → 전수조사
3. 질 → 양
4. 인과관계 → 상관관계

빅데이터 가치 산정이 어려운 이유
1. 데이터 활용 방식
2. 새로운 가치 창출
3. 분석 기술의 발전

빅데이터가 미치는 영향 : 생활 전반의 스마트화(기업, 정부, 개인)
빅데이터 활용 기본 테크닉 7가지(와 핵심키워드)
1. 연관규칙 학습: 상관관계
2. 유형분석: 범주/분류
3. 유전 알고리즘: 최적화
4. 기계학습: '훈련 데이터, 특성, 예측, ex.딥러닝
5. 회귀분석: 원인과 결과
6. 감정분석: 감정
7. 소셜 네트워크 분석: 사회관계망 분석, 관계
위기요인
1. 사생활 침해: '개인정보가 포함된 데이터'
2. 책임 원칙 훼손: 예측 알고리즘의 희생양, 가능성이 높다는 이유 - 책임 - 민주주의 사회 원칙을 크게 훼손
3. 데이터 오용: 과신, 잘못된 지표, 잘못된 인사이트

통제방안
1. 사생활 침해의 통제 방안 → ‘동의에서 책임으로’
2. 책임 원칙 훼손의 통제 방안 → ‘결과 기반 책임 원칙 고수’
3. 데이터 오용의 위기요소에 대한 대응책 → ‘알고리즘 접근권 허용/인증’
+ 불이익을 당한 사람들을 대변할 전문가 알고리즈미스트(Algorithmist)가 필요
 
빅데이터 활용의 3요소: 데이터, 기술, 인력

개인정보 비식별 기술: 데이터 마스킹, 가명처리, 총계처리, 데이터값 삭제, 데이터 범주화
빅데이터 열풍과 회의론: 과거 CRM의 부정적 학습효과, 과대 포장
빅데이터 분석: 1. 크기가 아닌 ‘인사이트’ 2. 전략적 인사이트의 중요성

산업별 일차원적인 분석: '트레이딩'은 '에너지' 산업! '프로그램 트레이딩'은 '금융 서비스' 산업!
일차원적 분석: 업계 내부의 문제에만 포커스, 부서 단위로 관리되기 때문에 비즈니스 성공에 핵심적인 역할을 기대X --> 활용 범위를 더 넓고 전략적으로 변화시킴으로써 전략적 인사이트를 주는 가치 기반 분석 단계

데이터 사이언스: 데이터로부터 의미 있는 정보를 추출해내는 학문
통계학: '정형화된 실험 데이터' vs 데이터 사이언스: '다양한 유형의 데이터'

데이터 사이언티스트의 역량: 분석 영역, IT 영역, 비즈니스 관점
하드 스킬: 빅데이터 지식, 기술 숙련 등
소프트 스킬: 통찰력, 소통 등
가트너  제시 역량: 데이터 관리, 분석 모델링, 비즈니스 분석, 소프트 스킬

데이터 사이언스: 소프트 스킬은 인문학과 관련: '과학과 인문의 교차로'
인문학적 사고: 과거- 현재 -미래
가치 패러다임의 변화: 디지털화(과거) - 연결(현재) - 에이전시(미래)





AI로 생성된 이미지



 

데이터 레벨업! 전처리 & 시각화 세션
5회차

seaborn (as sns) 라이브러리: pandas dataframe과의 연동 우수
1. 간결한 코드
2. 통계 시각화 기능 제공
3. pandas와의 호환성 高
4. 다양한 시각적 스타일 제공
sns.barplot(data=data_a, x="A", y="B") 
바플롯 외에 boxplot, violinplot, swarmplot, lineplot, histplot 등등
산점도(scatterplot) 에 옵션 부여도 가능
hue=A  A에 따른 색 다르게
style=B   B에 따른 모양 다르게
size=C    C에 따른 점 크기 다르게
sizes=(20,200) 점 크기 범위

빈도그래프(countplot) :  알아서 개수를 세줌

히트맵(heatmap): matplotlib 보단 seaborn 사용
pairplot: 모든 수치형 변수의 관계를 보여줌
 
색상의 선택
발표자료 색상 발표와 어울리는 색으로 (즉, 푸른 떡볶이처럼 만들지 않기)
강조하고자 하는 것에 진한 색

Matplotlib 에서 여러 그래프를 그리려면 subplot 사용해야 함
But, Seaborn과 Plotly는 Faceting 기능(그래프 쪼개기): Col 옵션

회귀선(추세선)이 있는 산점도: lmplot
히스토그램과 산점도를 동시에 보는: jointplot
겹치지 않는 산점도(적은 데이터양): swarmplot
Plotly 라이브러리
마우스 오버가 가능(-> 웹페이지나 대시보드에서 사용자와 상호작용 가능)
sunbrust 차트: 한정된 공간에 많은 필터를 보여줘야 할 때
애니매이션 차트: 슬라이드처럼 보여주는 기능

ydata-profiling 라이브러리
pip install ydata-profiling
가장 유명한 EDA 자동화 라이브러리1

Sweetviz 라이브러리
pip install sweetviz
EDA 자동화 라이브러리2

pygwalker 라이브러리

3. 학습하며 겪었던 문제점& 에러 + 회고

3-1 문제점& 에러: 코드카타 중 채점 단계에서 시간 초과로 인한 실패 - 

문제의 코드: 59번 덧칠하기(https://school.programmers.co.kr/learn/courses/30/lessons/161989)
# 실패한 코드
def solution(n, m, section):
#  n미터인 벽, 롤러의 길이는 m미터, 1미터 n개로 벽을 나누고 롤러가 벽을 벗어나면 안 됨
    result = 0
    while len(section) > 0:
        result += 1
        start = section[0]
        for i in range(m):
            j = start + i
            if j in section:
                section.remove(j)
    return result
# 수정한 방법: <if in문 + section.remove() >문 대신 다른 방법 차용
def solution(n, m, section):
    result = 0
    last = 0  
    for i in section:
        if i > last:
            result += 1  
            last = i+m-1
    return result

3-2 회고: 슬슬 아침 코드카타가 너무 벅차다

 


4. 내일 학습할 것은 무엇인지(기본적인 AI 진단퀴즈, 코드카타, TIL 제외)

- 금요일(5일): 할당된 강의(없으면 ADsP 강의), 어학