문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
PySpark와 머신러닝
모듈 1: 빅데이터 및 Spark 기초
- 빅데이터 생태계 개요 및 현대 데이터 플랫폼에서의 Spark 역할
- Spark 아키텍처 이해: 드라이버, 실행기, 클러스터 매니저, 지연 평가 기법, DAG 및 실행 계획 방식
- RDD와 DataFrame API 간의 차이점 및 각각의 사용 시점 판단 방법
- SparkSession 생성 및 구성 방법과 애플리케이션 설정의 기본 사항 이해
모듈 2: PySpark DataFrames
- CSV, JSON, Parquet, Delta 등 다양한 기업용 데이터 소스와 형식 간의 읽기 및 쓰기 기능
- PySpark DataFrames 다루는 법: 변환 작업, 액션 수행, 컬럼 표현식 활용, 필터링, 조인 연산 및 집계 처리
- 윈도우 함수 적용, 타임스탬프 다루기, 중첩 구조 데이터 처리와 같은 고급 기법 수행 방법
- 데이터 품질 검증 절차 적용 및 재사용 가능하며 유지보수성 높은 PySpark 코드 작성 방식
모듈 3: 대규모 데이터셋 효율적 처리
- 성능 최적화 기본 원칙 이해: 파티셔닝 전략, 셔플 동작 방식, 캐싱 및 데이터 영구 저장법
- 브로드캐스트 조인 기법 활용과 실행 계획 분석 등의 최적화 접근법 적용 방법
- 대규모 데이터셋을 효과적으로 처리하고 확장 가능한 데이터 워크플로우를 구축하기 위한 모범 사례들
- 스키마 진화 과정 및 기업 환경에서 사용되는 최신 저장 형식에 대한 이해도 향상
모듈 4: 대규모 피처 엔지니어링
- Spark MLlib를 활용한 피처 생성 작업: 결측치 처리, 범주형 변수 인코딩 및 스케일링 기법 적용
- 재사용 가능한 전처리 단계 설계 방법과 머신러닝 파이프라인을 위한 데이터 준비 방식
- 피처 선택 방법론 및 불균형한 데이터셋 처리 접근법 소개
모듈 5: Spark MLlib를 활용한 머신러닝
- MLlib 아키텍처 이해와 Estimator 및 Transformer 패턴의 구조적 원리
- 대규모 데이터 환경에서 선형 회귀, 로지스틱 회귀, 의사결정나무 및 랜덤 포레스트 등 다양한 회귀/분류 모델 훈련 방법
- 여러 모델 간 성능 비교 분석과 분산형 머신러닝 환경에서의 결과 해석 방식
모듈 6: 종단간 머신러닝 파이프라인
- 전처리 단계부터 피처 생성 및 모델링까지 모두 포함하는 종단간 머신러닝 파이프라인 구축 방법
- 훈련용, 검증용, 테스트용 데이터셋 분리 기법 활용 방식
- 그리드 서치 및 무작위 탐색법을 이용한 교차 검증과 하이퍼파라미터 최적화 실시 절차
- 재현 가능한 머신러닝 실험 체계 구축 방법
모듈 7: 모델 평가 및 실무 적용 기반 의사결정
- 회귀 분석과 분류 문제에 각각 적합한 평가 지표 선정 방법
- 과적합 및 과소적합 현상 판단법과 실무 환경에서 모델 선택 시 의사결정 절차
- 각 피처의 기여도 해석 방식 및 전체적인 모델 동작 특성 파악 방법
모듈 8: 운영 환경 적용과 기업용 실무 가이드라인
- Spark에서 모델 영구 저장 및 로딩 처리 방법
- 대규모 데이터셋을 대상으로 한 배치 추론 워크플로우 설계 방식
- 기업 환경에서의 머신러닝 생명주기 개요 설명
- 버전 관리, 실험 추적 메커니즘 소개 및 기초적인 테스트 전략 이해
실습을 통한 최종 성과
- 독립적으로 PySpark 사용 능력 습득
- 대규모 데이터셋을 효율적으로 처리할 수 있는 역량 배양
- 대용량 환경에서 피처 엔지니어링 진행 능력 향상
- 확장 가능한 머신러닝 파이프라인 설계 및 구축 역량 확보
요건
참가자분들께서는 다음과 같은 배경 지식을 보유하고 계셔야 합니다:
함수, 데이터 구조 및 라이브러리 활용에 대한 기본적인 Python 프로그래밍 지식
데이터셋, 변환 과정 및 집계 방법 등 데이터 분석의 기초 개념
SQL과 관계형 데이터 개념에 대한 기본 이해
훈련용 데이터셋, 피처 및 평가 지표와 같은 머신러닝의 기본 개념
명령줄 환경 사용법 및 소프트웨어 개발 방식에 익숙하시면 더욱 좋습니다
Pandas, NumPy 등 유사한 데이터 처리 라이브러리 경험이 있으면 도움이 되나 필수 사항은 아닙니다.
21 시간
회원 평가 (1)
실제로 적용할 수 있어 좋았습니다. 이론적인 지식을 실제 예를 통해 적용하는 것이 매우 좋아졌습니다.
Aurelia-Adriana - Allianz Services Romania
코스 - Python and Spark for Big Data (PySpark)
기계 번역됨