연락처 정보

코스 개요

각 세션은 2시간입니다.

1일차: 세션 -1: 정부에서 왜 빅데이터 비즈니스 인텔리전스인가? 비즈니스 개요

  • NIH, DOE 사례 연구
  • 정부 기관의 빅데이터 도입률과 어떻게 빅데이터 예측 분석을 중심으로 미래 운영을 정렬하고 있는지
  • DoD, NSA, IRS, USDA 등에서의 광범위한 적용 영역
  • 레거시 데이터와의 빅데이터 인터페이싱
  • 예측 분석을 가능하게 하는 기술에 대한 기본 이해
  • 데이터 통합 및 대시보드 시각화
  • 사기 관리
  • 비즈니스 규칙/사기 탐지 생성
  • 위협 탐지 및 프로파일링
  • 빅데이터 구현에 대한 비용 대비 효과 분석

1일차: 세션-2 : 빅데이터 소개-1

  • 빅데이터의 주요 특성-용량, 다양성, 속도, 그리고 정확성. 용량을 위한 MPP 아키텍처.
  • 데이터 웨어하우스 – 정적인 스키마, 서서히 진화하는 데이터셋
  • Greenplum, Exadata, Teradata, Netezza, Vertica와 같은 MPP 데이터베이스.
  • Hadoop 기반 솔루션 – 데이터셋 구조에 대한 조건 없음.
  • 전형적인 패턴 : HDFS, MapReduce(crunch), HDFS에서 가져오기
  • 배치- 분석/비대화형에 적합
  • 용량 : CEP 스트리밍 데이터
  • 전형적인 선택지 – CEP 제품 (예: Infostreams, Apama, MarkLogic 등)
  • 생태계 준비 덜 됨 – Storm/S4
  • NoSQL 데이터베이스 – (컬럼형 및 키-값형): 데이터 웨어하우스/데이터베이스의 분석 보조로 가장 적합

1일차 : 세션 -3 : 빅데이터 소개-2

NoSQL 솔루션

  • KV 저장소 - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV 저장소 - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV 저장소 (계층형) - GT.m, Cache
  • KV 저장소 (순서형) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV 캐시 - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • 튜플 저장소 - Gigaspaces, Coord, Apache River
  • 오브젝트 데이터베이스 - ZopeDB, DB40, Shoal
  • 문서 저장소 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • 광폭 컬럼형 저장소 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

데이터의 다양성: 빅데이터에서 데이터 클리닝 문제 소개

  • RDBMS – 정적인 구조/스키마, 민첩하고 탐색적인 환경을 촉진하지 않음.
  • NoSQL – 반정형, 데이터를 저장하기 전에 정확한 스키마 없이 데이터를 저장할 수 있는 충분한 구조
  • 데이터 클리닝 문제

1일차 : 세션-4 : 빅데이터 소개-3 : Hadoop

  • Hadoop을 언제 선택해야 하는가?
  • 정형 - 엔터프라이즈 데이터 웨어하우스/데이터베이스는 대량의 데이터를 저장할 수 있지만(비용 부담), 구조를 부과함(능동적인 탐색에 적합하지 않음)
  • 반정형 데이터 – 전통적인 솔루션(DW/DB)으로 처리하기 어려움
  • 데이터 웨어하우스화 = 막대한 노력과 구현 후에도 정적인 상태
  • 데이터의 다양성 및 용량, 컨모디티 하드웨어로 crunching – HADOOP
  • Hadoop 클러스터를 만들기 위한 컨모디티 H/W 필요

MapReduce/HDFS 소개

  • MapReduce – 여러 서버에 걸쳐 컴퓨팅 분산
  • HDFS – 컴퓨팅 프로세스를 위해 데이터를 로컬로 사용 가능하게 함(중복성을 통해)
  • 데이터 – 비정형/스키마 없음 (RDBMS와 달리)
  • 개발자가 데이터의 의미를 파악하는 책임
  • MapReduce 프로그래밍 = Java 작업 (장점/단점), HDFS에 데이터 수동 로딩

2일차: 세션-1: 빅데이터 생태계-빅데이터 ETL 구축: 빅데이터 도구의 우주-어떤 것을 언제 사용할 것인가?

  • Hadoop vs. 기타 NoSQL 솔루션
  • 대화형, 무작위 접근을 위해
  • Hadoop 위에 Hbase (컬럼 지향 데이터베이스)
  • 데이터의 무작위 접근 가능하지만 제한이 있음 (최대 1 PB)
  • 임시 분석에는 부적합, 로깅, 카운팅, 시계열에는 적합
  • Sqoop - 데이터베이스에서 Hive 또는 HDFS로 가져오기 (JDBC/ODBC 접근)
  • Flume – 스트리밍 데이터 (예: 로그 데이터)를 HDFS로 전송

2일차: 세션-2: 빅데이터 관리 시스템

  • 이동 부품, 컴퓨팅 노드 시작/실패 :ZooKeeper - 구성/조정/네이밍 서비스를 위해
  • 복잡한 파이프라인/워크플로: Oozie – 워크플로, 의존성, 데이지 체인 관리
  • 배포, 구성, 클러스터 관리, 업그레이드 등 (시스템 관리) :Ambari
  • 클라우드 내 : Whirr

2일차: 세션-3: 비즈니스 인텔리전스에서 예측 분석-1: 기본 기술 & 기계 학습 기반 BI :

  • 기계 학습 소개
  • 분류 기술 학습
  • 베이지안 예측-훈련 파일 준비
  • 지원 벡터 머신
  • KNN p-Tree 대수 & 세로 채굴
  • 신경망
  • 빅데이터 큰 변수 문제 -Random forest (RF)
  • 빅데이터 자동화 문제 – Multi-model ensemble RF
  • Soft10-M을 통한 자동화
  • 텍스트 분석 도구-Treeminer
  • 민첩한 학습
  • 에이전트 기반 학습
  • 분산 학습
  • 예측 분석을 위한 오픈 소스 도구 소개 : R, Rapidminer, Mahut

2일차: 세션-4 예측 분석 생태계-2: 정부에서 공통적인 예측 분석 문제

  • 인사이트 분석
  • 시각화 분석
  • 정형 예측 분석
  • 비정형 예측 분석
  • 위협/사기/벤더 프로파일링
  • 추천 엔진
  • 패턴 탐지
  • 규칙/시나리오 발견 – 실패, 사기, 최적화
  • 근본 원인 발견
  • 감정 분석
  • CRM 분석
  • 네트워크 분석
  • 텍스트 분석
  • 기술 보조 검토
  • 사기 분석
  • 실시간 분석

3일차 : 세션-1 : Hadoop을 통한 실시간 및 확장 가능한 분석

  • 공통적인 분석 알고리즘이 Hadoop/HDFS에서 실패하는 이유
  • Apache Hama- Bulk Synchronous 분산 컴퓨팅을 위해
  • Apache SPARK- 실시간 분석을 위한 클러스터 컴퓨팅
  • CMU Graphics Lab2- 분산 컴퓨팅을 위한 그래프 기반 비동기 방식
  • Treeminer의 KNN p-대수 기반 방식으로 운영 하드웨어 비용 절감

3일차: 세션-2: eDiscovery 및 포렌식 도구

  • 빅데이터 vs. 레거시 데이터에 대한 eDiscovery – 비용 및 성능 비교
  • 예측 코딩 및 기술 보조 검토 (TAR)
  • 더 빠른 발견을 위해 TAR가 작동하는 방식을 이해하기 위한 TAR 제품(vMiner) 라이브 데모
  • HDFS를 통한 더 빠른 인덱싱 – 데이터의 속도
  • NLP 또는 자연어 처리 – 다양한 기법과 오픈 소스 제품
  • 외국어에서의 eDiscovery- 외국어 처리 기술

3일차 : 세션 3: 사이버 보안을 위한 빅데이터 BI – 빠른 데이터 수집부터 위협 식별까지의 전체 360도 뷰 이해

  • 보안 분석 기본 이해-공격 표면, 보안 오설정, 호스트 방어
  • 네트워크 인프라/ 대형 데이터 파이프 / 실시간 분석을 위한 응답 ETL
  • 처방적 vs 예측적 – 고정된 규칙 기반 vs 메타데이터로부터 위협 규칙 자동 발견

3일차: 세션 4: USDA에서의 빅데이터 : 농업에서의 응용

  • 농업을 위한 IoT (사물인터넷) 소개- 센서 기반 빅데이터와 제어
  • 위성 영상 기술 소개 및 농업에서의 응용
  • 토양 비료, 재배 추천 및 예보를 위한 센서 및 영상 데이터 통합
  • 농업 보험과 빅데이터
  • 농작물 손실 예보

4일차 : 세션-1: 정부에서 빅데이터로부터의 사기 방지 BI-사기 분석:

  • 사기 분석의 기본 분류- 규칙 기반 vs 예측 분석
  • 사기 패턴 탐지를 위한 감시 학습 vs 비지도 학습
  • 벤더 사기/프로젝트에 대한 과다 청구
  • 메디케어와 메디케이드 사기- 청구 처리를 위한 사기 탐지 기술
  • 여행비 정산 사기
  • IRS 환불 사기
  • 데이터가 제공되는 경우 사례 연구와 라이브 데모가 제공됩니다.

4일차 : 세션-2: 소셜 미디어 분석- 정보 수집 및 분석

  • 소셜 미디어 데이터를 추출하기 위한 빅데이터 ETL API
  • 텍스트, 이미지, 메타 데이터 및 비디오
  • 소셜 미디어 피드에서의 감정 분석
  • 소셜 미디어 피드의 컨텍스트 및 컨텍스트 없는 필터링
  • 다양한 소셜 미디어를 통합하는 소셜 미디어 대시보드
  • 소셜 미디어 프로필의 자동화된 프로파일링
  • 각 분석에 대한 라이브 데모가 Treeminer 도구를 통해 제공됩니다.

4일차 : 세션-3: 이미지 처리 및 비디오 피드에서의 빅데이터 분석

  • 빅데이터에서의 이미지 저장 기술- 페타바이트를 초과하는 데이터를 위한 저장 솔루션
  • LTFS와 LTO
  • GPFS-LTFS (빅 이미지 데이터를 위한 계층적 저장 솔루션)
  • 이미지 분석 기본
  • 객체 인식
  • 이미지 분할
  • 모션 트래킹
  • 3D 이미지 재구성

4일차: 세션-4: NIH에서의 빅데이터 응용:

  • 바이오인포마틱스의 신흥 분야
  • 메타게놈학 및 빅데이터 채굴 문제
  • 약물유전체학, 대사체학 및 단백체학에 대한 빅데이터 예측 분석
  • 하위 유전체학 프로세스에서의 빅데이터
  • 공중 보건에서의 빅데이터 예측 분석 응용

다양한 데이터의 빠른 접근성 및 표시를 위한 빅데이터 대시보드 :

  • 기존 애플리케이션 플랫폼과 빅데이터 대시보드의 통합
  • 빅데이터 관리
  • 빅데이터 대시보드 사례 연구: Tableau와 Pentaho
  • 정부에서 위치 기반 서비스를 추진하기 위한 빅데이터 앱 사용
  • 추적 시스템 및 관리

5일차 : 세션-1: 조직 내에서 빅데이터 BI 구현을 어떻게 정당화하는가:

  • 빅데이터 구현을 위한 ROI 정의
  • 데이터 수집 및 준비를 위한 분석사 시간 절감 사례 연구 – 생산성 향상
  • 라이선스 데이터베이스 비용 절감으로 인한 수익 증가 사례 연구
  • 위치 기반 서비스로부터의 수익 증가
  • 사기 방지를 통한 절감
  • 빅데이터 구현으로 인한 대략적인 비용 vs. 수익/절감을 계산하기 위한 통합 스프레드시트 접근법.

5일차 : 세션-2: 레거시 데이터 시스템을 빅데이터 시스템으로 교체하는 단계별 절차:

  • 실용적인 빅데이터 마이그레이션 로드맵 이해
  • 빅데이터 구현을 아키텍처링하기 전에 필요한 중요한 정보
  • 데이터의 용량, 속도, 다양성, 정확성을 계산하는 다양한 방식
  • 데이터 성장 추정 방법
  • 사례 연구

5일차: 세션 4: 빅데이터 벤더 검토 및 제품 검토. Q/A 세션:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

요건

  • 해당 도메인에서 정부의 비즈니스 운영 및 데이터 시스템에 대한 기본 지식
  • SQL/Oracle 또는 관계형 데이터베이스에 대한 기본 이해
  • 통계에 대한 기본 이해 (스프레드시트 수준)
 35 시간

참가자 수


참가자별 가격

회원 평가 (1)

예정된 코스

관련 카테고리