문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
각 세션은 2시간입니다.
1일차: 세션 -1: 정부에서 왜 빅데이터 비즈니스 인텔리전스인가? 비즈니스 개요
- NIH, DOE 사례 연구
- 정부 기관의 빅데이터 도입률과 어떻게 빅데이터 예측 분석을 중심으로 미래 운영을 정렬하고 있는지
- DoD, NSA, IRS, USDA 등에서의 광범위한 적용 영역
- 레거시 데이터와의 빅데이터 인터페이싱
- 예측 분석을 가능하게 하는 기술에 대한 기본 이해
- 데이터 통합 및 대시보드 시각화
- 사기 관리
- 비즈니스 규칙/사기 탐지 생성
- 위협 탐지 및 프로파일링
- 빅데이터 구현에 대한 비용 대비 효과 분석
1일차: 세션-2 : 빅데이터 소개-1
- 빅데이터의 주요 특성-용량, 다양성, 속도, 그리고 정확성. 용량을 위한 MPP 아키텍처.
- 데이터 웨어하우스 – 정적인 스키마, 서서히 진화하는 데이터셋
- Greenplum, Exadata, Teradata, Netezza, Vertica와 같은 MPP 데이터베이스.
- Hadoop 기반 솔루션 – 데이터셋 구조에 대한 조건 없음.
- 전형적인 패턴 : HDFS, MapReduce(crunch), HDFS에서 가져오기
- 배치- 분석/비대화형에 적합
- 용량 : CEP 스트리밍 데이터
- 전형적인 선택지 – CEP 제품 (예: Infostreams, Apama, MarkLogic 등)
- 생태계 준비 덜 됨 – Storm/S4
- NoSQL 데이터베이스 – (컬럼형 및 키-값형): 데이터 웨어하우스/데이터베이스의 분석 보조로 가장 적합
1일차 : 세션 -3 : 빅데이터 소개-2
NoSQL 솔루션
- KV 저장소 - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV 저장소 - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV 저장소 (계층형) - GT.m, Cache
- KV 저장소 (순서형) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV 캐시 - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- 튜플 저장소 - Gigaspaces, Coord, Apache River
- 오브젝트 데이터베이스 - ZopeDB, DB40, Shoal
- 문서 저장소 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- 광폭 컬럼형 저장소 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
데이터의 다양성: 빅데이터에서 데이터 클리닝 문제 소개
- RDBMS – 정적인 구조/스키마, 민첩하고 탐색적인 환경을 촉진하지 않음.
- NoSQL – 반정형, 데이터를 저장하기 전에 정확한 스키마 없이 데이터를 저장할 수 있는 충분한 구조
- 데이터 클리닝 문제
1일차 : 세션-4 : 빅데이터 소개-3 : Hadoop
- Hadoop을 언제 선택해야 하는가?
- 정형 - 엔터프라이즈 데이터 웨어하우스/데이터베이스는 대량의 데이터를 저장할 수 있지만(비용 부담), 구조를 부과함(능동적인 탐색에 적합하지 않음)
- 반정형 데이터 – 전통적인 솔루션(DW/DB)으로 처리하기 어려움
- 데이터 웨어하우스화 = 막대한 노력과 구현 후에도 정적인 상태
- 데이터의 다양성 및 용량, 컨모디티 하드웨어로 crunching – HADOOP
- Hadoop 클러스터를 만들기 위한 컨모디티 H/W 필요
MapReduce/HDFS 소개
- MapReduce – 여러 서버에 걸쳐 컴퓨팅 분산
- HDFS – 컴퓨팅 프로세스를 위해 데이터를 로컬로 사용 가능하게 함(중복성을 통해)
- 데이터 – 비정형/스키마 없음 (RDBMS와 달리)
- 개발자가 데이터의 의미를 파악하는 책임
- MapReduce 프로그래밍 = Java 작업 (장점/단점), HDFS에 데이터 수동 로딩
2일차: 세션-1: 빅데이터 생태계-빅데이터 ETL 구축: 빅데이터 도구의 우주-어떤 것을 언제 사용할 것인가?
- Hadoop vs. 기타 NoSQL 솔루션
- 대화형, 무작위 접근을 위해
- Hadoop 위에 Hbase (컬럼 지향 데이터베이스)
- 데이터의 무작위 접근 가능하지만 제한이 있음 (최대 1 PB)
- 임시 분석에는 부적합, 로깅, 카운팅, 시계열에는 적합
- Sqoop - 데이터베이스에서 Hive 또는 HDFS로 가져오기 (JDBC/ODBC 접근)
- Flume – 스트리밍 데이터 (예: 로그 데이터)를 HDFS로 전송
2일차: 세션-2: 빅데이터 관리 시스템
- 이동 부품, 컴퓨팅 노드 시작/실패 :ZooKeeper - 구성/조정/네이밍 서비스를 위해
- 복잡한 파이프라인/워크플로: Oozie – 워크플로, 의존성, 데이지 체인 관리
- 배포, 구성, 클러스터 관리, 업그레이드 등 (시스템 관리) :Ambari
- 클라우드 내 : Whirr
2일차: 세션-3: 비즈니스 인텔리전스에서 예측 분석-1: 기본 기술 & 기계 학습 기반 BI :
- 기계 학습 소개
- 분류 기술 학습
- 베이지안 예측-훈련 파일 준비
- 지원 벡터 머신
- KNN p-Tree 대수 & 세로 채굴
- 신경망
- 빅데이터 큰 변수 문제 -Random forest (RF)
- 빅데이터 자동화 문제 – Multi-model ensemble RF
- Soft10-M을 통한 자동화
- 텍스트 분석 도구-Treeminer
- 민첩한 학습
- 에이전트 기반 학습
- 분산 학습
- 예측 분석을 위한 오픈 소스 도구 소개 : R, Rapidminer, Mahut
2일차: 세션-4 예측 분석 생태계-2: 정부에서 공통적인 예측 분석 문제
- 인사이트 분석
- 시각화 분석
- 정형 예측 분석
- 비정형 예측 분석
- 위협/사기/벤더 프로파일링
- 추천 엔진
- 패턴 탐지
- 규칙/시나리오 발견 – 실패, 사기, 최적화
- 근본 원인 발견
- 감정 분석
- CRM 분석
- 네트워크 분석
- 텍스트 분석
- 기술 보조 검토
- 사기 분석
- 실시간 분석
3일차 : 세션-1 : Hadoop을 통한 실시간 및 확장 가능한 분석
- 공통적인 분석 알고리즘이 Hadoop/HDFS에서 실패하는 이유
- Apache Hama- Bulk Synchronous 분산 컴퓨팅을 위해
- Apache SPARK- 실시간 분석을 위한 클러스터 컴퓨팅
- CMU Graphics Lab2- 분산 컴퓨팅을 위한 그래프 기반 비동기 방식
- Treeminer의 KNN p-대수 기반 방식으로 운영 하드웨어 비용 절감
3일차: 세션-2: eDiscovery 및 포렌식 도구
- 빅데이터 vs. 레거시 데이터에 대한 eDiscovery – 비용 및 성능 비교
- 예측 코딩 및 기술 보조 검토 (TAR)
- 더 빠른 발견을 위해 TAR가 작동하는 방식을 이해하기 위한 TAR 제품(vMiner) 라이브 데모
- HDFS를 통한 더 빠른 인덱싱 – 데이터의 속도
- NLP 또는 자연어 처리 – 다양한 기법과 오픈 소스 제품
- 외국어에서의 eDiscovery- 외국어 처리 기술
3일차 : 세션 3: 사이버 보안을 위한 빅데이터 BI – 빠른 데이터 수집부터 위협 식별까지의 전체 360도 뷰 이해
- 보안 분석 기본 이해-공격 표면, 보안 오설정, 호스트 방어
- 네트워크 인프라/ 대형 데이터 파이프 / 실시간 분석을 위한 응답 ETL
- 처방적 vs 예측적 – 고정된 규칙 기반 vs 메타데이터로부터 위협 규칙 자동 발견
3일차: 세션 4: USDA에서의 빅데이터 : 농업에서의 응용
- 농업을 위한 IoT (사물인터넷) 소개- 센서 기반 빅데이터와 제어
- 위성 영상 기술 소개 및 농업에서의 응용
- 토양 비료, 재배 추천 및 예보를 위한 센서 및 영상 데이터 통합
- 농업 보험과 빅데이터
- 농작물 손실 예보
4일차 : 세션-1: 정부에서 빅데이터로부터의 사기 방지 BI-사기 분석:
- 사기 분석의 기본 분류- 규칙 기반 vs 예측 분석
- 사기 패턴 탐지를 위한 감시 학습 vs 비지도 학습
- 벤더 사기/프로젝트에 대한 과다 청구
- 메디케어와 메디케이드 사기- 청구 처리를 위한 사기 탐지 기술
- 여행비 정산 사기
- IRS 환불 사기
- 데이터가 제공되는 경우 사례 연구와 라이브 데모가 제공됩니다.
4일차 : 세션-2: 소셜 미디어 분석- 정보 수집 및 분석
- 소셜 미디어 데이터를 추출하기 위한 빅데이터 ETL API
- 텍스트, 이미지, 메타 데이터 및 비디오
- 소셜 미디어 피드에서의 감정 분석
- 소셜 미디어 피드의 컨텍스트 및 컨텍스트 없는 필터링
- 다양한 소셜 미디어를 통합하는 소셜 미디어 대시보드
- 소셜 미디어 프로필의 자동화된 프로파일링
- 각 분석에 대한 라이브 데모가 Treeminer 도구를 통해 제공됩니다.
4일차 : 세션-3: 이미지 처리 및 비디오 피드에서의 빅데이터 분석
- 빅데이터에서의 이미지 저장 기술- 페타바이트를 초과하는 데이터를 위한 저장 솔루션
- LTFS와 LTO
- GPFS-LTFS (빅 이미지 데이터를 위한 계층적 저장 솔루션)
- 이미지 분석 기본
- 객체 인식
- 이미지 분할
- 모션 트래킹
- 3D 이미지 재구성
4일차: 세션-4: NIH에서의 빅데이터 응용:
- 바이오인포마틱스의 신흥 분야
- 메타게놈학 및 빅데이터 채굴 문제
- 약물유전체학, 대사체학 및 단백체학에 대한 빅데이터 예측 분석
- 하위 유전체학 프로세스에서의 빅데이터
- 공중 보건에서의 빅데이터 예측 분석 응용
다양한 데이터의 빠른 접근성 및 표시를 위한 빅데이터 대시보드 :
- 기존 애플리케이션 플랫폼과 빅데이터 대시보드의 통합
- 빅데이터 관리
- 빅데이터 대시보드 사례 연구: Tableau와 Pentaho
- 정부에서 위치 기반 서비스를 추진하기 위한 빅데이터 앱 사용
- 추적 시스템 및 관리
5일차 : 세션-1: 조직 내에서 빅데이터 BI 구현을 어떻게 정당화하는가:
- 빅데이터 구현을 위한 ROI 정의
- 데이터 수집 및 준비를 위한 분석사 시간 절감 사례 연구 – 생산성 향상
- 라이선스 데이터베이스 비용 절감으로 인한 수익 증가 사례 연구
- 위치 기반 서비스로부터의 수익 증가
- 사기 방지를 통한 절감
- 빅데이터 구현으로 인한 대략적인 비용 vs. 수익/절감을 계산하기 위한 통합 스프레드시트 접근법.
5일차 : 세션-2: 레거시 데이터 시스템을 빅데이터 시스템으로 교체하는 단계별 절차:
- 실용적인 빅데이터 마이그레이션 로드맵 이해
- 빅데이터 구현을 아키텍처링하기 전에 필요한 중요한 정보
- 데이터의 용량, 속도, 다양성, 정확성을 계산하는 다양한 방식
- 데이터 성장 추정 방법
- 사례 연구
5일차: 세션 4: 빅데이터 벤더 검토 및 제품 검토. Q/A 세션:
- Accenture
- APTEAN (Formerly CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Formerly 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Part of EMC)
요건
- 해당 도메인에서 정부의 비즈니스 운영 및 데이터 시스템에 대한 기본 지식
- SQL/Oracle 또는 관계형 데이터베이스에 대한 기본 이해
- 통계에 대한 기본 이해 (스프레드시트 수준)
35 시간
회원 평가 (1)
트레이너가 과정을 단순히 제공하는 것이 아니라 조직의 요구 사항에 맞추는 능력입니다.
Masilonyane - Revenue Services Lesotho
코스 - Big Data Business Intelligence for Govt. Agencies
기계 번역됨