전체 글
-
2026년 4월 9일 분류, 경사하강법SK네트웍스 Family AI 캠프 29기/일지 2026. 5. 1. 23:56
## 분류- MNIST 데이터로 연습- 숫자 이미지를 행렬 데이터로 표현- 이진, 다진 분류기- 확률적 경사 하강법- StratifedKFold: 비율을 고려한 KFold- 정밀도 precision(양성 예측의 정확도), 재현율 recall(분류기가 정확하게 감지한 양성 샘플 비율)- 재현율. 실제 데이터- 정밀도와 재현율은 트레이드오프 관계- 분류모델 점수는 f1 점수로 판단. 조화 평균- roc를 통해 시각적으로 성능을 판단### 경사하강법(Gradient Decent)- 얼마나 틀렸는지 점수를 매기는 손실함수(Loss Function) --> 손실함수의 값이 최소(궁극적 목적은 0)- 미분값(기울기) = (온도변화량 100) / (손잡이 움직인 양 1) = 100 - 미분값(기울기) = (온도변화량..
-
20260408 머신러닝 및 서류 특강SK네트웍스 Family AI 캠프 29기/일지 2026. 5. 1. 23:50
머신러닝훈련세트(학습, 테스트 데이터), 모델값 예측과 분류는 같은 회귀 알고리즘을 사용 가능0일 확률, 1일 확률로지스틱 회귀(분류에 널리 쓰이는 알고리즘)사례를 잘 대표하는 데이터가 중요샘플이 작으면 우연에 의한 대표성 없는 데이터가 발생 가능성 있음매우 큰 데이터셋 내 샘플 선정도 잘못되면 문제 발생 가능성비지도학습데이터를 집단끼리 묶음계층 군집 알고리즘준지도학습레이블이 일부만 있음자기지도레이블 없음강화학습환경, 행동, 보상, 벌점배치학습오프라인, 온라인 학습학습률높으면 빠르게 적응하고 금방 잊음, 낮으면 느리지만 새로운 데이터의 잡음에 강함과적합규제: 과적합 위험을 줄이기 위해 모델에 제약테스트와 검증훈련, 검증, 테스트처음 훈련 진행 후 일부 데이터는 추가로 검증 단계에서 학습수치형 컬럼disc..
-
20260407 머신러닝 선형회귀SK네트웍스 Family AI 캠프 29기/일지 2026. 4. 29. 19:10
2026년 4월 7일머신러닝선형회귀데이터를 학습 시키고 학습 시킨 데이터와 동일한 값을 넣었을 때 결과 예측이 학습과 다른 이유 -> 모델은 학습 데이터를 기억하지 않아 다른 데이터들의 학습으로 인해 예상치가 다를 수 있음데이터가 2개 이상인 경우 어떻게 동작하는지 -> 아직 잘 이해가 안되는데 컬럼 하나일때와 동일하게 모든 컬럼의 대한 가중치(기울기)를 구함모델 스코어는 0~1 사이이고 1에 가까울수록 좋은 모델음수일 경우 학습이 잘못된 경우이므로 폐기y^ 예측값로그변환과 정규화의 차이👉로그 변환 → 데이터의 “분포(shape)”를 바꿈👉정규화 → 데이터의 “범위(scale)”만 바꿈정규화는 데이터를 특정 범위(주로 0~1)로 압축하고, 표준화는 평균 0, 표준편차 1을 가지도록 데이터를 재분포시킴..
-
20260406 시각화SK네트웍스 Family AI 캠프 29기/일지 2026. 4. 29. 19:08
2026년 4월 6일시각화데이터 많으면 데이터베이스 아니면 판다스에서 그룹 처리 가능seaborn matplotlib.pyplotseaborn이 matplotlib 보다 사용하기 간단도형/도표 (Plot): 데이터를 좌표계에 점으로 찍어 나타낸 그래프.무게가 증가하면 치수도 증가하는 관계 (치수 vs 가격 허위 상관관계)추론할때 불필요한 계수 즉 변수임.. 따라서 머신러닝할때는 학습에서 제외vif카글 https://www.kaggle.com/ 시각화 데이터복습plot 선bar 막대scatter 점 흩뿌리다', '(흩어져) 퍼지다', '분산시키다, 산점도(Scatter plot)코드 패턴 (30%)fig, ax = plt.subplots(figsize=(width, height))ax.plot() / ax..
-
20260402 PandasSK네트웍스 Family AI 캠프 29기/일지 2026. 4. 29. 18:39
### Pandas- 판다스 인덱스 중복 가능. 같은 인덱스 조회 시 리스트로 반환- 직접 지정한 idx 말고 0부터 시작하는 고유 인덱스는 레거시 기능 deprecated. 인덱스로 접근하고 싶으면 .iloc[인덱스]로 사용- 시리즈끼리 합칠 시 인덱스가 겹치지 않을 경우 합집합 같이 처리. 빈값은 NAN- https://www.data.go.kr/data/15083033/fileData.do- https://www.data.go.kr/data/15083033/fileData.do### 표준편차- 분산(Variance): 데이터가 평균에서 떨어진 거리를 제곱하여 평균을 낸 값 ().- 표준편차: 분산은 단위를 제곱하기 때문에, 원래 자료의 단위와 맞추기 위해 제곱근을 씌운 값 ().- 해석: 표준편차가..
-
20260401 numpySK네트웍스 Family AI 캠프 29기/일지 2026. 4. 29. 18:38
### numpy- 대규모 수치 처리 라이브러리- c로 구현- python 분산 저장. 포인터 배열- 캐시- 반복문, 리스트 컴프리헨션, numpy 벡터 연산 : 500, 100, 5ms#### 벡터화 연산- 반복문 처리가 아닌 한번에 처리#### 다차원 배열 이해- 디멘션: 데이터 바라보는 차원- 0 스칼라 점, 1 벡터 선, 2 행렬 면, 3 텐서 공간, 4~- 벡터 (5, ) 요소가 5개- shape: 행렬의 모양- 텐서: 높이, 너비, 채널수. (1080, 1920, 3)- python 자료구조와 numpy 차이: 배열에 * 3 할 경우 파이썬은 단순 3번 반복, numpy는 모든 요소를 3 곱함#### 배열 속성 요약- numpy 모양, 요소 데이터 타입, 채널 수 등#### 난수- 신경망 가중..