코스 개요
1일차
범죄 정보 분석을 위한 빅데이터 비즈니스 인텔리전스 개요
- 법 집행 분야 사례 연구 - 예측적 경찰 활동.
- 각국 법 집행 기관의 빅데이터 도입 현황 및 향후 운영 방향과의 연계 관계.
- 총격 감지 센서, 감시 영상, 소셜 미디어 등 신기술 솔루션.
- 정보 과부하 완화를 위한 빅데이터 기술 활용 방법.
- 레거시 시스템 데이터와 빅데이터 간의 연동 방안.
- 예측 분석을 가능케 하는 기반 기술에 대한 이해.
- 데이터 통합 및 대시보드 시각화 기법.
- 사기 행위 관리 방법.
- 비즈니스 규칙 기반 사기 탐지 체계.
- 위협 감지 및 프로파일링 기법.
- 빅데이터 도입의 비용 편익 분석 방법.
빅데이터 개론
- 빅데이터의 주요 특성 - 양, 다양성, 속도, 신뢰도.
- MPP (대규모 병렬 처리) 아키텍처 설명.
- 데이터 웨어하우스 - 정적인 스키마와 천천히 변하는 데이터 집합.
- MPP 기반 데이터베이스: Greenplum, Exadata, Teradata, Netezza, Vertica 등.
- Hadoop 기반 솔루션 - 데이터 구조에 제한 없음.
- 일반적인 구성 패턴: HDFS, MapReduce 활용 및 이로부터의 데이터 추출.
- 스트림 처리를 위한 Apache Spark 설명.
- 분석 작업이나 비상호작용형 처리에 적합한 배치 방식.
- 양이 많은 경우를 위한 CEP 스트림 데이터 활용 방법.
- 흔히 사용되는 CEP 제품군: Infostreams, Apama, MarkLogic 등.
- 아직 실제 도입은 진행 중인 Storm/S4 같은 기술들.
- NoSQL 데이터베이스 - 컬럼 기반 및 키-값 방식으로 데이터 웨어하우스 보조용으로 적합.
NoSQL 솔루션 종류
- 키-값 저장소: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
- 키-값 저장소: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB.
- 계층형 키-값 저장소: GT.m, Cache.
- 순서 기반 키-값 저장소: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
- 키 캐시: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua.
- 튜플 저장소: Gigaspaces, Coord, Apache River.
- 객체 기반 데이터베이스: ZopeDB, DB40, Shoal.
- 문서형 저장소: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris.
- 와이드 컬럼형 저장소: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.
데이터 다양성 및 빅데이터 환경에서의 데이터 정리 문제에 대한 소개
- RDBMS - 고정된 구조로 유연한 탐색적 활용이 제한됨.
- NoSQL - 반구조화된 형태로 스키마 없이도 저장 가능하여 기동성이 높음.
- 데이터 정리 관련 문제들.
Hadoop에 대한 소개
- Hadoop을 언제 선택해야 할까?
- 구조화된 데이터는 기업용 데이터 웨어하우스나 데이터베이스에서도 처리가 가능하나 운영 비용 부담 큼.
하지만 탐색적 활용에는 부적합함. - 반구조화된 데이터의 경우 전통적인 DW/DB 체계로는 처리가 어려움.
- 데이터 웨어하우스 구축은 막대한 노력과 비용이 요구되며 설치 후에도 고정적임.
- 양과 다양성이 큰 데이터를 일반 하드웨어 환경에서 빠르게 처리하는 데는 Hadoop 적합함.
- Hadoop 클러스터 구축 시 일반형 컴퓨팅 장비만 필요함.
MapReduce 및 HDFS에 대한 입문
- MapReduce - 여러 서버에 분산하여 연산을 처리하는 기법.
- HDFS - 중복 기능이 포함되어 데이터를 각각의 서버에서 접근 가능하게 함.
- 데이터 형태는 구조화되지 않거나 스키마가 없어도 가능함 (RDBMS와 다름).
- 개발자의 몫으로 주어진 데이터를 의미 있게 해석해야 함.
- MapReduce 프로그래밍은 Java 사용을 기본으로 하며 단점/장점이 존재하고 수동적으로 HDFS에 데이터 로딩 가능.
2일차
빅데이터 생태계 -- 빅데이터 ETL(추출, 변환, 적재) 구축 및 사용 시기와 적합한 도구 선택법
- Hadoop과 기타 NoSQL 솔루션의 차이점.
- 데이터에 대한 상호작용적이고 무작위 접근을 필요로 할 때 활용 가능성.
- Hadoop 위에서 작동하는 컬럼형 데이터베이스인 HBase.
- 무작위 접근은 가능하나 최대 1PB라는 용량 제한 존재함.
- 임시 분석에 부적합하지만 로그 기록, 계수, 시계열 처리 등엔 유용함.
- Sqoop - 데이터베이스에서 Hive 또는 HDFS로 정보를 가져올 때 사용 (JDBC/ODBC 접속).
- Flume - 로그와 같은 스트림 형식의 데이터를 HDFS에 자동으로 수집.
빅데이터 관리 시스템 소개
- 계산 노드가 실시간으로 시작/중단될 때 설정을 통제하고 명명 기능을 담당하는 ZooKeeper.
- 복잡한 파이프라인 및 워크플로우 관리를 위한 Oozie - 의존 관계와 체인 연결 조정 기능 제공.
- 배포, 설치 구성, 클러스터 관리 및 업데이트 등 시스템 운영에 필요한 기능을 제공하는 Ambari.
- 클라우드 환경 전용 솔루션으로 Whirr 존재함.
예측 분석 -- 기본 기술과 머신러닝 기반 비즈니스 인텔리전스
- 머신러닝에 대한 개요.
- 분류 기법 습득 방법.
- 베이지안 예측법 - 학습용 데이터 파일 준비 절차.
- 서포트 벡터 머신(SVM).
- KNN p-트리 대수와 수직 마이닝 방법.
- 신경망 기반 알고리즘 설명.
- 변수가 매우 많은 빅데이터 환경에서는 랜덤 포레스트(RF) 유용함.
- 자동화 수준이 요구되는 빅데이터 작업엔 다중 모델 통합 RF 기법 적합함.
- Soft10-M을 활용한 자동 처리 가능성.
- 텍스트 분석 도구인 Treeminer에 대한 소개.
- 유연한 학습 모드에 대해 배움.
- 에이전트 기반 학습 방법 설명.
- 분산형 학습 절차 이해.
- 예측 분석 활용을 위한 오픈소스 도구: R, Python, Rapidminer, Mahut 소개.
예측 분석 생태계와 범죄 정보 분석 분야에서의 적용 사례
- 기술과 수사 과정 간 연관성 파악 방법.
- 통찰 기반 분석법.
- 시각적 데이터 분석 방식.
- 구조화된 예측 모델 설계 가능성.
- 비구조화 데이터를 대상으로 한 예측 방법론 활용.
- 위협, 사기, 판매처 프로파일링 기술.
- 추천 엔진 구축 방법.
- 패턴 인식 및 탐지 방안.
- 규칙이나 시나리오 발견을 통한 오류 분석, 사기 탐지, 최적화 수단 설정법.
- 원인 분석 기술.
- 감성 분석 방법.
- CRM 데이터 분석 활용 방식.
- 네트워크 구조 파악 및 분석법.
- 녹취록, 증언서, 인터넷 상의 대화 등에서 인사이트를 뽑아내는 텍스트 분석 기술.
- 기술 기반 자료 검토 절차.
- 사기 행위 탐지 및 분석법.
- 실시간 데이터 분석 활용 방식.
3일차
Hadoop 위에서의 실시간 확장 가능한 데이터 처리 기법
- 일반적인 분석 알고리즘이 Hadoop/HDFS에서는 왜 잘 작동하지 않는가.
- 대량 동기식 분산 컴퓨팅을 위한 Apache Hama 설명.
- 클러스터 컴퓨팅과 실시간 데이터 분석 도구인 Apache SPARK 활용법.
- 그래프 기반 비동기 분산 처리 기법을 연구 중인 CMU 그래픽스 랩 소개.
- 하드웨어 비용 절감 목적의 Treeminer 제공 KNN p-대수 방식 설명.
eDiscovery 및 포렌식 도구 종류
- 빅데이터 기반 eDiscovery와 레거시 데이터 대상 경우의 비용 및 성능 비교.
- 예측 코딩과 기술 보조 수사 검토(TAR) 설명.
- TAR을 통해 더 신속한 자료 추출이 가능함을 vMiner 실시간 데모로 증명.
- HDFS를 통한 빠른 색인 구축으로 데이터 처리 속도 향상 효과.
- 자연어 처리(NLP)에 활용되는 오픈소스 제품 및 기법 소개.
- 다양 언어 대상 분석 기술 설명.
사이버 보안 분야에서의 빅데이터 BI 활용법 - 전방위 시각화, 신속한 자료 수집과 위협 파악 방법
- 보안 분석 기초 개념 정리 -- 공격 영역, 설정 오류, 호스트 보호 기능 등.
- 네트워크 인프라와 대용량 데이터 흐름 통제 및 실시간 분석 ETL 시스템 구성법.
- 고정 규칙 기반 접근과 메타데이터 기반 위협 탐지 자동화 간의 차이점.
범죄 정보 분석을 위한 다양한 자료 수집 전략
- 센서로 활용되는 IoT 장치를 이용한 데이터 수집 방안.
- 국내 감시 목적으로 위성 이미지 활용 가능성.
- 감시 및 영상 기록을 통해 범죄자 신원 식별법.
- 드론, 몸에 부착하는 카메라, GPS 태깅 시스템, 열화상 촬영 기술 등 타 자료 수집 장치들.
- 정보 제공자와의 면담 내용이나 조사 결과물을 자동으로 획득되는 데이터와 통합하는 방법.
- 범죄 발생 예측 모델 구축 절차.
4일차
사기 분석 분야에서 빅데이터를 활용한 비즈니스 인텔리전스 도입 효과
- 규칙 기반 및 예측적 사기 분석 간 차이점.
- 지도학습과 비지도학습 기반 사기 패턴 파악 방법.
- B2B 사기, 의료 보험 관련 부정행위, 보험 사고 유발 목적의 범죄 행동, 탈세 및 자금 세탁 활동 소개.
소셜 미디어 분석 -- 정보 수집과 활용 방안
- 범죄자들이 단체 조직, 인원 모집, 계획 수립 시 활용하는 SNS의 특성 설명.
- SNS 자료 추출을 위한 빅데이터 ETL API 활용법.
- 텍스트, 이미지, 메타데이터 및 동영상 정보 정리 방안.
- 소셜 미디어 피드의 감성 분석 기술 설명.
- SNS 내용의 문맥 유무에 따른 필터링 방법 설명.
- 다양한 소셜 서비스를 하나로 통합하는 대시보드 구성법.
- SNS 계정 자동 프로파일링 도구 설명.
- Treeminer 프로그램을 사용하여 각종 분석 과정을 실시간 데모로 보여줌.
이미지 처리 및 영상 데이터의 빅데이터 분석법
- 페타바이트급에 달하는 이미지 데이터 저장 기술 설명.
- LTFS (선형 테이프 파일 시스템)와 LTO(선형 테이프 오픈) 활용 방식.
- GPFS-LTFS라는 계층적 스토리지 체계가 대량 이미지 자료를 효과적으로 저장하는 방법.
- 이미지 분석의 기본 원리 설명.
- 객체 식별 및 구분 방법론.
- 이미지 세분화 처리 기술 설명.
- 움직임 추적 방안 설명.
- 3차원 이미지 복원 절차.
생체 인식, DNA 데이터 활용 및 차세대 신원 확인 시스템 소개
- 기존 지문 인식이나 안면 식별 외의 추가 수단 설명.
- 음성 인식, 키보드 입력 패턴 분석 기술, CODIS(DNA 색인 통합 시스템) 활용법.
- DNA 매칭 외에 범죄자 얼굴 형태까지 예측하는 법의학적 DNA 표현 기술 소개.
다양한 자료를 신속하게 활용할 수 있는 빅데이터 대시보드 구축 방안:
- 기존 애플리케이션과 빅데이터 대시보드 간 통합 방법.
- 빅데이터 관리 체계의 필요성.
- Tableau 및 Pentaho를 활용한 실제 사례 설명.
- 지역 정보 기반 서비스 도입을 위한 빅데이터 응용 방안.
- 추적 시스템과 운영 통제 기술.
5일차
조직 내에서 빅데이터 BI 활용 효과 입증법:
- 빅데이터 구축의 ROI(투자 수익률) 측정 기준 정립법.
- 데이터 모음 및 준비 과정에서 분석가 업무 시간 절약을 가져오는 사례 소개.
이를 통해 업무 생산성이 향상됨을 강조함. - 데이터베이스 라이선스 비용 절감에 따른 수익 확대 효과.
- 지역 기반 서비스 운영 활성화로 인한 경제적 이득.
- 사기 방지 성과를 통한 비용 절약 정도 설명.
- 빅데이터 도입에 따른 예상 지출액과 수익·비용 절감분을 산정하기 위한
스프레드시트 기반 평가법 소개.
레거시 시스템 대신 빅데이터 체계로 전환하는 단계별 실행 계획:
- 빅데이터 이전을 위한 로드맵 구성법.
- 빅데이터 체계 구축 시 필수적으로 파악해야 할 핵심 정보 목록 정리.
- 데이터의 양, 속도, 다양성 및 신뢰도를 측정하는 여러 방법 소개.
- 향후 데이터 증가 추세 예측 방안 설명.
- 다양한 업계 사례 분석 내용 제공.
빅데이터 관련 업체와 각사 제품 평가:
- Accenture
- APTEAN (구 CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (구 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (EMC 계열)
질의응답 시간
요건
- 법 집행 프로세스와 데이터 시스템에 대한 이해 필요.
- SQL/Oracle 또는 관계형 데이터베이스에 대한 기본 지식 필수.
- 통계학에 대한 기초적인 이해 (스프레드시트 수준).
대상 청중
- 기술적 배경을 갖춘 법 집행 전문가들.
회원 평가 (3)
기초를 배우고 준비된 문서와 연습문제를 좋아했습니다
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
코스 - Introduction to Predictive AI
기계 번역됨
딥티는 제 필요에 매우 잘 맞춰주었으며, 언제 복잡성을 추가할지, 언제 구조화된 접근을 취하며 뒤로 물러나야 할지를 알 수 있었습니다. 딥티는 진정으로 제 속도에 맞춰 일했으며, 먼저 보여주고 제가 직접 재생성하도록 함으로써 새로운 기능/도구를 스스로 사용할 수 있도록 도와주었습니다. 이를 통해 훈련이 정말 잘 고착되었습니다. 이 훈련의 결과와 딥티의 전문성 수준에 매우 만족합니다!
Deepthi - Invest Northern Ireland
코스 - IBM Cognos Analytics
기계 번역됨
그는 철저히 준비를 했으며, 매우 친절합니다.
Oliver - Post CH AG
코스 - Splunk Fundamentals
기계 번역됨