문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
소개:
- Hadoop 에코시스템 내 아파치 스파크
- Python 및 Scala 간략 소개
기초 이론:
- 아키텍처 개요
- RDD의 이해
- 변환(Transformation)과 작업(Actions)
- 스테이지, 작업, 종속성 관계
Databricks 환경 활용을 통한 실습: 기초 이해하기:
- RDD API를 활용한 연습 문제
- 기본적인 변환 및 작업 함수들
- PairRDD 개념과 사용법
- 데이터 결합(Join) 처리 방법
- 캐싱 전략 설정법
- DataFrame API를 이용한 실습
- SparkSQL 기초 활용법
- DataFrame에서 데이터 필터링, 그룹화, 정렬 등 수행 방법
- UDF(User Defined Function) 작성 방법
- DataSet API의 개념 및 특징 탐구
- 실시간 데이터 처리(Streaming) 기초
AWS 환경을 활용한 실습: 배포 방법 이해하기:
- AWS Glue의 기본 개념 파악
- AWS EMR과 AWS Glue 간 주요 차이점 비교
- 두 환경에서 실제로 작업을 수행해보기
- AWS 서비스별 장단점 비교 분석
추가 내용:
- Apache Airflow 기반 워크플로우 오케스트레이션 입문
요건
프로그래밍 능력 (특히 Python, Scala에 익숙할수록 좋음)
SQL 기초 지식
21 시간
회원 평가 (3)
실습/과제 수행하기
Poornima Chenthamarakshan - Intelligent Medical Objects
코스 - Apache Spark in the Cloud
기계 번역됨
1. 고수준 개념과 기술적 세부 사항 사이의 적절한 균형. 2. 안드라시는 자신의 강의에 대해 매우 밝습니다. 3. 연습
Steven Wu - Intelligent Medical Objects
코스 - Apache Spark in the Cloud
기계 번역됨
스파크 스트리밍, Databricks 및 AWS Redshift를 배우게 됩니다.
Lim Meng Tee - Jobstreet.com Shared Services Sdn. Bhd.
코스 - Apache Spark in the Cloud
기계 번역됨