연락처 정보
 기간 21 시간

코스 개요

서론

이 섹션에서는 '머신러닝'을 사용할 시점, 고려해야 할 사항, 그리고 전반적인 의미 및 장단점에 대해 일반적인 도입을 제공합니다. 데이터 유형(구조화/비구조화/정적/스트림), 데이터 유효성/볼륨, 데이터 주도 vs 사용자 주도 분석, 통계 모델 vs 머신러닝 모델/비지도 학습의 도전 과제, 편차-분산 트레이드오프, 반복/평가, 교차 검증 접근법, 지도/비지도/강화 학습을 다룹니다.

주요 주제

1. 나이브 베이즈 이해

  • 베이지안 방법의 기본 개념
  • 확률
  • 합성 확률
  • 베이즈 정리를 활용한 조건부 확률
  • 나이브 베이즈 알고리즘
  • 나이브 베이즈 분류
  • 라플라스 추정기
  • 나이브 베이즈에서 수치형 피처 사용

2. 의사결정나무 이해

  • 분할 정복법
  • C5.0 의사결정나무 알고리즘
  • 최적 분할 선택
  • 의사결정나무 가지치기

3. 신경망 이해

  • 생물학적 뉴런에서 인공 뉴런으로
  • 활성화 함수
  • 네트워크 구조
  • 레이어의 수
  • 정보 전달 방향
  • 각 레이어의 노드 수
  • 역전파를 통한 신경망 학습
  • 딥러닝

4. 서포트 벡터 머신(SVM) 이해

  • 초평면으로 하는 분류
  • 최대 마진 찾기
  • 선형 분리 가능 데이터의 경우
  • 선형 분리 불가능 데이터의 경우
  • 비선형 공간에서 커널 사용

5. 군집화 이해

  • 군집화를 하나의 머신러닝 태스크로 보기
  • 군집화를 위한 k-means 알고리즘
  • 거리를 이용한 클러스터 할당 및 업데이트
  • 적절한 클러스터 수 선택

6. 분류를 위한 성능 측정

  • 분류 예측 데이터 작업
  • 혼동 행렬에 대한 깊이 있는 분석
  • 혼동 행렬을 활용한 성능 측정
  • 정확도(Beyond accuracy)를 넘어선 기타 성능 지표
  • 카파(Kappa) 통계량
  • 민감도와 특이도
  • 정밀도와 재현율
  • F-measure
  • 성능 트레이드오프 시각화
  • ROC 곡선
  • 미래 성능 추정
  • 홀드아웃(holdout) 방법
  • 교차 검증
  • 부트스트랩 샘플링

7. 더 나은 성능을 위한 기본 모델 튜닝

  • caret을 활용한 자동 파라미터 튜닝
  • 간단한 튜닝된 모델 생성
  • 튜닝 과정 커스터마이징
  • 메타러닝을 통한 모델 성능 향상
  • 앙상블 이해
  • Bagging
  • Boosting
  • Random forests
  • Random forests 학습
  • Random forests 성능 평가

부차적 주제

8. 최인접 이웃을 이용한 분류 이해

  • kNN 알고리즘
  • 거리 계산
  • 적절한 k 선택
  • kNN 사용 데이터 준비
  • kNN 알고리즘이 왜 게으르다(Lazy)는가?/li>

9. 분류 규칙 이해

  • 분리 및 정복
  • One Rule 알고리즘
  • RIPPER 알고리즘
  • 의사결정나무로부터의 규칙

10. 회귀 분석 이해

  • 단순 선형 회귀
  • 일반 최소제곱 추정
  • 상관관계
  • 다중 선형 회귀

11. 회귀 나무와 모델 나무 이해

  • 나무에 회귀 추가하기

12. 연관 규칙 이해

  • 연관 규칙 학습을 위한 Apriori 알고리즘
  • 규칙 관심도 측정 – 서포트와 신뢰도
  • Apriori 원리를 이용한 규칙 세트 구축

추가

  • Spark/PySpark/MLlib 및 다팔 밴딧(Multi-armed bandits)

요건

파이썬(Python) 지식

참가자 수


참가자별 가격

회원 평가 (7)

예정된 코스

관련 카테고리