문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
소개, 목표 및 마이그레이션 전략
- 과정 목표, 참가자 프로필 정합성, 성공 기준
- 고급 마이그레이션 접근 방식 및 위험 요인 고려
- 워크스페이스, 리포지토리, 랩 데이터셋 설정
Day 1 — 마이그레이션 기초 및 아키텍처
- Lakehouse 개념, Delta Lake 개요, Databricks 아키텍처
- SMP와 MPP의 차이 및 마이그레이션에 미치는 영향
- 메달리언(Bronze→Silver→Gold) 설계 및 Unity Catalog 개요
Day 1 Lab — 저장 절차 변환
- 샘플 저장 절차의 노트북으로의 실습 마이그레이션
- 임시 테이블 및 커서를 DataFrame 변환으로 매핑
- 원본 출력과의 검증 및 비교
Day 2 — 고급 Delta Lake & 증분 로딩
- ACID 트랜잭션, 커밋 로그, 버전 관리, 타임 트래블
- Auto Loader, MERGE INTO 패턴, 업서트, 스키마 진화
- OPTIMIZE, VACUUM, Z-ORDER, 파티셔닝 및 스토리지 튜닝
Day 2 Lab — 증분 적재 & 최적화
- Auto Loader 적재 및 MERGE 워크플로 구현
- OPTIMIZE, Z-ORDER, VACUUM 적용 및 결과 검증
- 읽기/쓰기 성능 향상 측정
Day 3 — Databricks의 SQL, 성능 & 디버깅
- 분석 SQL 기능: 윈도우 함수, 고차 함수, JSON/배열 처리
- Spark UI 읽기, DAG, 셔플, 스테이지, 태스크 및 병목 진단
- 쿼리 튜닝 패턴: 브로드캐스트 조인, 힌트, 캐싱, 스피일 감소
Day 3 Lab — SQL 리팩토링 & 성능 튜닝
- 무거운 SQL 프로세스를 최적화된 Spark SQL로 리팩토링
- Spark UI 트레이스를 사용하여 스윙 및 셔플 문제 식별 및 수정
- 전후 벤치마킹 및 튜닝 단계 문서화
Day 4 — 전술적 PySpark: 절차적 로직 대체
- Spark 실행 모델: 드라이버, 엑스큐터, 레이어리 평가, 파티셔닝 전략
- 루프 및 커서를 벡터화된 DataFrame 연산으로 변환
- 모듈화, UDF/pandas UDF, 위젯, 재사용 가능한 라이브러리
Day 4 Lab — 절차적 스크립트 리팩토링
- 절차적 ETL 스크립트를 모듈화된 PySpark 노트북으로 리팩토링
- 파라미터화, 단위 테스트 스타일, 재사용 가능한 함수 도입
- 코드 리뷰 및 모범 사례 체크리스트 적용
Day 5 — 오케스트레이션, 엔드투엔드 파이프라인 & 모범 사례
- Databricks Workflows: 작업 설계, 태스크 의존성, 트리거, 오류 처리
- 품질 규칙 및 스키마 검증을 갖춘 증분 메달리언 파이프라인 설계
- Git(GitHub/Azure DevOps), CI 및 PySpark 로직에 대한 테스트 전략 통합
Day 5 Lab — 완전한 엔드투엔드 파이프라인 구축
- Workflows로 오케스트레이션된 Bronze→Silver→Gold 파이프라인 조립
- 로깅, 감사, 재시도, 자동화 검증 구현
- 전체 파이프라인 실행, 출력 검증, 배포 노트 준비
운영화, 거버넌스 및 프로덕션 준비
- Unity Catalog 거버넌스, 리네이지, 액세스 제어 모범 사례
- 비용, 클러스터 사이즈, 오토스케일링, 작업 동시성 패턴
- 배포 체크리스트, 롤백 전략, 런북 작성
최종 리뷰, 지식 이전 및 향후 계획
- 참가자의 마이그레이션 작업 및 교훈 발표
- 갭 분석, 권장 후속 활동, 교육 자료 인계
- 참고 자료, 추가 학습 경로, 지원 옵션
요건
- 데이터 엔지니어링 개념에 대한 이해
- SQL 및 저장 절차 경험 (Synapse / SQL Server)
- ETL 오케스트레이션 개념에 대한 친숙함 (ADF 또는 유사 도구)
대상 고객
- 데이터 엔지니어링 배경을 갖춘 기술 관리자
- 절차적 OLAP 로직을 Lakehouse 패턴으로 전환하는 데이터 엔지니어
- Databricks 채택을 책임지는 플랫폼 엔지니어
35 시간