연락처 정보

코스 개요

1일차

범죄 정보 분석을 위한 빅데이터 비즈니스 인텔리전스 개요

  • 법 집행 분야 사례 연구 - 예측적 경찰 활동.
  • 각국 법 집행 기관의 빅데이터 도입 현황 및 향후 운영 방향과의 연계 관계.
  • 총격 감지 센서, 감시 영상, 소셜 미디어 등 신기술 솔루션.
  • 정보 과부하 완화를 위한 빅데이터 기술 활용 방법.
  • 레거시 시스템 데이터와 빅데이터 간의 연동 방안.
  • 예측 분석을 가능케 하는 기반 기술에 대한 이해.
  • 데이터 통합 및 대시보드 시각화 기법.
  • 사기 행위 관리 방법.
  • 비즈니스 규칙 기반 사기 탐지 체계.
  • 위협 감지 및 프로파일링 기법.
  • 빅데이터 도입의 비용 편익 분석 방법.

빅데이터 개론

  • 빅데이터의 주요 특성 - 양, 다양성, 속도, 신뢰도.
  • MPP (대규모 병렬 처리) 아키텍처 설명.
  • 데이터 웨어하우스 - 정적인 스키마와 천천히 변하는 데이터 집합.
  • MPP 기반 데이터베이스: Greenplum, Exadata, Teradata, Netezza, Vertica 등.
  • Hadoop 기반 솔루션 - 데이터 구조에 제한 없음.
  • 일반적인 구성 패턴: HDFS, MapReduce 활용 및 이로부터의 데이터 추출.
  • 스트림 처리를 위한 Apache Spark 설명.
  • 분석 작업이나 비상호작용형 처리에 적합한 배치 방식.
  • 양이 많은 경우를 위한 CEP 스트림 데이터 활용 방법.
  • 흔히 사용되는 CEP 제품군: Infostreams, Apama, MarkLogic 등.
  • 아직 실제 도입은 진행 중인 Storm/S4 같은 기술들.
  • NoSQL 데이터베이스 - 컬럼 기반 및 키-값 방식으로 데이터 웨어하우스 보조용으로 적합.

NoSQL 솔루션 종류

  • 키-값 저장소: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
  • 키-값 저장소: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB.
  • 계층형 키-값 저장소: GT.m, Cache.
  • 순서 기반 키-값 저장소: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
  • 키 캐시: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua.
  • 튜플 저장소: Gigaspaces, Coord, Apache River.
  • 객체 기반 데이터베이스: ZopeDB, DB40, Shoal.
  • 문서형 저장소: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris.
  • 와이드 컬럼형 저장소: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.

데이터 다양성 및 빅데이터 환경에서의 데이터 정리 문제에 대한 소개

  • RDBMS - 고정된 구조로 유연한 탐색적 활용이 제한됨.
  • NoSQL - 반구조화된 형태로 스키마 없이도 저장 가능하여 기동성이 높음.
  • 데이터 정리 관련 문제들.

Hadoop에 대한 소개

  • Hadoop을 언제 선택해야 할까?
  • 구조화된 데이터는 기업용 데이터 웨어하우스나 데이터베이스에서도 처리가 가능하나 운영 비용 부담 큼.
    하지만 탐색적 활용에는 부적합함.
  • 반구조화된 데이터의 경우 전통적인 DW/DB 체계로는 처리가 어려움.
  • 데이터 웨어하우스 구축은 막대한 노력과 비용이 요구되며 설치 후에도 고정적임.
  • 양과 다양성이 큰 데이터를 일반 하드웨어 환경에서 빠르게 처리하는 데는 Hadoop 적합함.
  • Hadoop 클러스터 구축 시 일반형 컴퓨팅 장비만 필요함.

MapReduce 및 HDFS에 대한 입문

  • MapReduce - 여러 서버에 분산하여 연산을 처리하는 기법.
  • HDFS - 중복 기능이 포함되어 데이터를 각각의 서버에서 접근 가능하게 함.
  • 데이터 형태는 구조화되지 않거나 스키마가 없어도 가능함 (RDBMS와 다름).
  • 개발자의 몫으로 주어진 데이터를 의미 있게 해석해야 함.
  • MapReduce 프로그래밍은 Java 사용을 기본으로 하며 단점/장점이 존재하고 수동적으로 HDFS에 데이터 로딩 가능.

2일차

빅데이터 생태계 -- 빅데이터 ETL(추출, 변환, 적재) 구축 및 사용 시기와 적합한 도구 선택법

  • Hadoop과 기타 NoSQL 솔루션의 차이점.
  • 데이터에 대한 상호작용적이고 무작위 접근을 필요로 할 때 활용 가능성.
  • Hadoop 위에서 작동하는 컬럼형 데이터베이스인 HBase.
  • 무작위 접근은 가능하나 최대 1PB라는 용량 제한 존재함.
  • 임시 분석에 부적합하지만 로그 기록, 계수, 시계열 처리 등엔 유용함.
  • Sqoop - 데이터베이스에서 Hive 또는 HDFS로 정보를 가져올 때 사용 (JDBC/ODBC 접속).
  • Flume - 로그와 같은 스트림 형식의 데이터를 HDFS에 자동으로 수집.

빅데이터 관리 시스템 소개

  • 계산 노드가 실시간으로 시작/중단될 때 설정을 통제하고 명명 기능을 담당하는 ZooKeeper.
  • 복잡한 파이프라인 및 워크플로우 관리를 위한 Oozie - 의존 관계와 체인 연결 조정 기능 제공.
  • 배포, 설치 구성, 클러스터 관리 및 업데이트 등 시스템 운영에 필요한 기능을 제공하는 Ambari.
  • 클라우드 환경 전용 솔루션으로 Whirr 존재함.

예측 분석 -- 기본 기술과 머신러닝 기반 비즈니스 인텔리전스

  • 머신러닝에 대한 개요.
  • 분류 기법 습득 방법.
  • 베이지안 예측법 - 학습용 데이터 파일 준비 절차.
  • 서포트 벡터 머신(SVM).
  • KNN p-트리 대수와 수직 마이닝 방법.
  • 신경망 기반 알고리즘 설명.
  • 변수가 매우 많은 빅데이터 환경에서는 랜덤 포레스트(RF) 유용함.
  • 자동화 수준이 요구되는 빅데이터 작업엔 다중 모델 통합 RF 기법 적합함.
  • Soft10-M을 활용한 자동 처리 가능성.
  • 텍스트 분석 도구인 Treeminer에 대한 소개.
  • 유연한 학습 모드에 대해 배움.
  • 에이전트 기반 학습 방법 설명.
  • 분산형 학습 절차 이해.
  • 예측 분석 활용을 위한 오픈소스 도구: R, Python, Rapidminer, Mahut 소개.

예측 분석 생태계와 범죄 정보 분석 분야에서의 적용 사례

  • 기술과 수사 과정 간 연관성 파악 방법.
  • 통찰 기반 분석법.
  • 시각적 데이터 분석 방식.
  • 구조화된 예측 모델 설계 가능성.
  • 비구조화 데이터를 대상으로 한 예측 방법론 활용.
  • 위협, 사기, 판매처 프로파일링 기술.
  • 추천 엔진 구축 방법.
  • 패턴 인식 및 탐지 방안.
  • 규칙이나 시나리오 발견을 통한 오류 분석, 사기 탐지, 최적화 수단 설정법.
  • 원인 분석 기술.
  • 감성 분석 방법.
  • CRM 데이터 분석 활용 방식.
  • 네트워크 구조 파악 및 분석법.
  • 녹취록, 증언서, 인터넷 상의 대화 등에서 인사이트를 뽑아내는 텍스트 분석 기술.
  • 기술 기반 자료 검토 절차.
  • 사기 행위 탐지 및 분석법.
  • 실시간 데이터 분석 활용 방식.

3일차

Hadoop 위에서의 실시간 확장 가능한 데이터 처리 기법

  • 일반적인 분석 알고리즘이 Hadoop/HDFS에서는 왜 잘 작동하지 않는가.
  • 대량 동기식 분산 컴퓨팅을 위한 Apache Hama 설명.
  • 클러스터 컴퓨팅과 실시간 데이터 분석 도구인 Apache SPARK 활용법.
  • 그래프 기반 비동기 분산 처리 기법을 연구 중인 CMU 그래픽스 랩 소개.
  • 하드웨어 비용 절감 목적의 Treeminer 제공 KNN p-대수 방식 설명.

eDiscovery 및 포렌식 도구 종류

  • 빅데이터 기반 eDiscovery와 레거시 데이터 대상 경우의 비용 및 성능 비교.
  • 예측 코딩과 기술 보조 수사 검토(TAR) 설명.
  • TAR을 통해 더 신속한 자료 추출이 가능함을 vMiner 실시간 데모로 증명.
  • HDFS를 통한 빠른 색인 구축으로 데이터 처리 속도 향상 효과.
  • 자연어 처리(NLP)에 활용되는 오픈소스 제품 및 기법 소개.
  • 다양 언어 대상 분석 기술 설명.

사이버 보안 분야에서의 빅데이터 BI 활용법 - 전방위 시각화, 신속한 자료 수집과 위협 파악 방법

  • 보안 분석 기초 개념 정리 -- 공격 영역, 설정 오류, 호스트 보호 기능 등.
  • 네트워크 인프라와 대용량 데이터 흐름 통제 및 실시간 분석 ETL 시스템 구성법.
  • 고정 규칙 기반 접근과 메타데이터 기반 위협 탐지 자동화 간의 차이점.

범죄 정보 분석을 위한 다양한 자료 수집 전략

  • 센서로 활용되는 IoT 장치를 이용한 데이터 수집 방안.
  • 국내 감시 목적으로 위성 이미지 활용 가능성.
  • 감시 및 영상 기록을 통해 범죄자 신원 식별법.
  • 드론, 몸에 부착하는 카메라, GPS 태깅 시스템, 열화상 촬영 기술 등 타 자료 수집 장치들.
  • 정보 제공자와의 면담 내용이나 조사 결과물을 자동으로 획득되는 데이터와 통합하는 방법.
  • 범죄 발생 예측 모델 구축 절차.

4일차

사기 분석 분야에서 빅데이터를 활용한 비즈니스 인텔리전스 도입 효과

  • 규칙 기반 및 예측적 사기 분석 간 차이점.
  • 지도학습과 비지도학습 기반 사기 패턴 파악 방법.
  • B2B 사기, 의료 보험 관련 부정행위, 보험 사고 유발 목적의 범죄 행동, 탈세 및 자금 세탁 활동 소개.

소셜 미디어 분석 -- 정보 수집과 활용 방안

  • 범죄자들이 단체 조직, 인원 모집, 계획 수립 시 활용하는 SNS의 특성 설명.
  • SNS 자료 추출을 위한 빅데이터 ETL API 활용법.
  • 텍스트, 이미지, 메타데이터 및 동영상 정보 정리 방안.
  • 소셜 미디어 피드의 감성 분석 기술 설명.
  • SNS 내용의 문맥 유무에 따른 필터링 방법 설명.
  • 다양한 소셜 서비스를 하나로 통합하는 대시보드 구성법.
  • SNS 계정 자동 프로파일링 도구 설명.
  • Treeminer 프로그램을 사용하여 각종 분석 과정을 실시간 데모로 보여줌.

이미지 처리 및 영상 데이터의 빅데이터 분석법

  • 페타바이트급에 달하는 이미지 데이터 저장 기술 설명.
  • LTFS (선형 테이프 파일 시스템)와 LTO(선형 테이프 오픈) 활용 방식.
  • GPFS-LTFS라는 계층적 스토리지 체계가 대량 이미지 자료를 효과적으로 저장하는 방법.
  • 이미지 분석의 기본 원리 설명.
  • 객체 식별 및 구분 방법론.
  • 이미지 세분화 처리 기술 설명.
  • 움직임 추적 방안 설명.
  • 3차원 이미지 복원 절차.

생체 인식, DNA 데이터 활용 및 차세대 신원 확인 시스템 소개

  • 기존 지문 인식이나 안면 식별 외의 추가 수단 설명.
  • 음성 인식, 키보드 입력 패턴 분석 기술, CODIS(DNA 색인 통합 시스템) 활용법.
  • DNA 매칭 외에 범죄자 얼굴 형태까지 예측하는 법의학적 DNA 표현 기술 소개.

다양한 자료를 신속하게 활용할 수 있는 빅데이터 대시보드 구축 방안:

  • 기존 애플리케이션과 빅데이터 대시보드 간 통합 방법.
  • 빅데이터 관리 체계의 필요성.
  • Tableau 및 Pentaho를 활용한 실제 사례 설명.
  • 지역 정보 기반 서비스 도입을 위한 빅데이터 응용 방안.
  • 추적 시스템과 운영 통제 기술.

5일차

조직 내에서 빅데이터 BI 활용 효과 입증법:

  • 빅데이터 구축의 ROI(투자 수익률) 측정 기준 정립법.
  • 데이터 모음 및 준비 과정에서 분석가 업무 시간 절약을 가져오는 사례 소개.
    이를 통해 업무 생산성이 향상됨을 강조함.
  • 데이터베이스 라이선스 비용 절감에 따른 수익 확대 효과.
  • 지역 기반 서비스 운영 활성화로 인한 경제적 이득.
  • 사기 방지 성과를 통한 비용 절약 정도 설명.
  • 빅데이터 도입에 따른 예상 지출액과 수익·비용 절감분을 산정하기 위한
    스프레드시트 기반 평가법 소개.

레거시 시스템 대신 빅데이터 체계로 전환하는 단계별 실행 계획:

  • 빅데이터 이전을 위한 로드맵 구성법.
  • 빅데이터 체계 구축 시 필수적으로 파악해야 할 핵심 정보 목록 정리.
  • 데이터의 양, 속도, 다양성 및 신뢰도를 측정하는 여러 방법 소개.
  • 향후 데이터 증가 추세 예측 방안 설명.
  • 다양한 업계 사례 분석 내용 제공.

빅데이터 관련 업체와 각사 제품 평가:

  • Accenture
  • APTEAN (구 CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (구 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (EMC 계열)

질의응답 시간

요건

  • 법 집행 프로세스와 데이터 시스템에 대한 이해 필요.
  • SQL/Oracle 또는 관계형 데이터베이스에 대한 기본 지식 필수.
  • 통계학에 대한 기초적인 이해 (스프레드시트 수준).

대상 청중

  • 기술적 배경을 갖춘 법 집행 전문가들.
 35 시간

참가자 수


참가자별 가격

회원 평가 (3)

예정된 코스

관련 카테고리