문의를 보내주셔서 감사합니다! 팀원이 곧 연락드리겠습니다.
예약을 보내주셔서 감사합니다! 저희 팀 멤버 중 한 분이 곧 연락드리겠습니다.
코스 개요
1일차: 기반 구축 — 데이터 섭취, 검색, 검색 결과 가져오기
모듈 1: 법률 엔지니어의 지형도
- 학습 목표 — 역할 이해, 법률 업무 내 AI의 위치 파악, 그리고 모든 과정에 관통하는 두 가지 리스크 인식.
- 주제
-
- 법률 엔지니어 역할의 정의와 지금 이 순간 채용이 급증하는 이유
- AI의 적용 분야: eDiscovery, 검토, 계약, 조사, 조사; 평이한 언어로 설명한 EDRM 모델
- 자체 구축(Build) vs. 구매(Buy)
- 모든 과정에 관통하는 두 가지 리스크: 기밀성/변호사-의뢰인 특권과 방어 가능성
모듈 2: 법률 데이터는 혼란스럽다 — 데이터 섭취와 추출
- 학습 목표 — 대규모 법률 데이터의 현실을 다루는 방법 습득.
- 주제
- 1,400개 이상의 파일 유형, 이메일 및 PST, 스캔된 종이 문서, 로드 파일(.dat/.opt); 중요한 임베디드 메타데이터
- 텍스트 추출(Tika), OCR, 그리고 선택 사항인 중복 제거
- 실습: FreeEed 데이터 섭취 — 의도적으로 혼란스러운 문서 세트(이메일/PST, 스캔, 로드 파일)에 대해 데이터 섭취 파이프라인 구축
모듈 3: 검색 및 검색 결과 가져오기 — 기반이 되는 원리
- 학습 목표 — 핵심 eDiscovery 원리 구축: 모든 것 안에 있는 것을 찾습니다.
- 주제 — 전체 텍스트 검색 및 인덱싱(Solr/Lucene); 관련성, 메타데이터 및 날짜 필터링; OCR 처리된 내용 검색
- 실습: eDiscovery 검색 — 코퍼스(자료 집합)에 인덱스를 생성하고 OCR 처리된 스캔 내용을 포함하여 실제 eDiscovery 스타일의 검색 실행
모듈 4: 법률 문서를 위한 RAG — 인용 출처 포함
- 학습 목표 — 출처를 인용하는 법률 문서 기반 RAG 구축.
- 주제
- 민감한 자료를 위한 검색(Retrieval), 파인 튜닝(Fine-tuning)이 아닌 이유 — 모델이 문서를 그대로 흡수하지 않기 때문
- 청킹(Chunking), 임베딩(Embeddings), 그리고 무엇보다 중요한 인용 출처/출처 추적(Provenance)
- 여러 문서 및 스레드 요약
- 실습: 인용 출처를 갖춘 법률 RAG — 문서 세트를 대상으로 출처 인용을 포함하여 답변하는 RAG 질의응답 시스템 구축
2일차: 비공개, 방어 가능, 배포 가능한 시스템 만들기
모듈 5: 비밀성, 변호사-의뢰인 특권, 로컬 서빙 — 특권 함정
- 학습 목표 — 법률 데이터를 로컬에 유지하고 이를 인증할 수 있는 능력 갖추기.
- 주제
- 클라우드 AI에 데이터를 전송했을 때 데이터가 실제로 어디로 가는가
- 특권 포기, 전문성 의무, 그리고 '비공개'의 스펙트럼(계약상 vs. 물리상)
- Morgan v. V2X 사례와 왜 로컬 환경이 법정에서 방어 가능한지
- 로컬 모델 서빙 (Ollama / vLLM) 및 외부 유출 트래픽 모니터링
- 실습: 로컬 모델 + 유출 방지 증명 — 로컬 모델을 끝에서 끝까지 실행하고, 모니터링을 통해 데이터가 외부로 유출되지 않았음을 증명
모듈 6: 방어 가능한 AI 리뷰
- 학습 목표 — AI 리뷰가 인정받을 수 있도록 측정 및 문서화하는 방법.
- 주제
- 법원에서 인정되는 수치: 회수율(Recall), 탈루율(Elusion), 정확도(Precision), 정답 데이터 검증(Ground-truth validation); TAR / 능동 학습(Active learning)
- 투명성(이 문서를 왜 코딩했는가?) 및 재현성(Reproducibility) — 모델 고정, 설정 고정, 모든 항목 기록
- 1년 후 누군가 당신의 리뷰를 다시 실행했을 때 동일한 결과를 얻을 수 있도록 하는 '방어 가능한 사건 스냅샷'
- 실습: 방어 가능한 리뷰 — 블라인드 정답 데이터를 기준으로 AI 리뷰를 측정하고 재현성 번들(패키지) 생성
모듈 7: 배포하기 — 워크플로우, 비공개 배포, 거버넌스
- 학습 목표 — 조각들을 워크플로우로 조립하고, 비공개로 배포하며, 점수를 매기는 것.
- 주제
- 사람의 개입(Human-in-the-loop)을 포함하는 다단계 법률 워크플로우 (섭취 → 검색 → 요약 → 검토 → 산출)
- 비공개/온프레미스 배포의 핵심 (컨테이너화; 데이터를 사내에 유지)
- 법률 분야 AI 거버넌스 개요, 그리고 SAIS-100(코끼리 규모 보안 AI 점수)으로 시스템 점수 매기기
- 실습: 점수 매기기 및 패키징 — 다단계 워크플로우 구성, SAIS-100으로 점수 매기기, 비공개 배포를 위해 패키징
캡스톤 프로젝트 (2일차에 걸쳐 통합)
- 비공개이고 방어 가능한 법률 AI 애플리케이션을 끝에서 끝까지 구축 — 혼란스러운 코퍼스를 섭취, 검색, 로컬 모델을 사용하여 인용 출처를 갖춘 질문 답변, 방어 가능한 리뷰 측정, 비공개 배포를 위한 패키징.
- 참가자들은 법률 엔지니어 직무에 해당되는 포트폴리오 프로젝트를 손에 쥔 채 수료를 마칩니다.
선택 3일차 / 고급 모듈 (3일차 또는 모듈 시리즈로 제공 가능)
- 조사: 엔티티, 관계, 타임라인 — 사람/조직/날짜 추출, 이메일 스레드 재구성, 연대기 작성, 유사 중복 및 문서 계보 매핑. 실습: 타임라인 및 엔티티/관계 뷰 구축.
- 에이전트 및 다단계 법률 워크플로우 (심화) — 더 풍부 오케스트레이션, 계약 분석, 다중 문서 종합, 도구 사용 및 가드레일을 설계 원칙으로. 실습: 인간 체크포인트를 갖춘 다단계 워크플로우 구축.
- 대규모 배포 — 온프레미스 및 어플라이언스 배포, 대량 볼륨을 위한 분산 처리, 규제된 환경(CJIS, 정부, 고등 교육), 하드웨어 크기 결정. 실습: 워커에 걸쳐 처리 작업을 컨테이너화 및 확장.
- 거버넌스 및 컴플라이언스 심화 — AI 규제 환경(미국 100개 이상의 주 AI 법, EU AI 법), 감사 요구 사항, 완전한 SAIS-100 거버넌스 감사. 실습: 거버넌스/방어 가능성 체크리스트를 기준으로 법률 AI 시스템 감사.
요건
- Python과 기본 API에 익숙함
- 있으면 좋음: LLM에 대한 사용자 수준의 이해 (ML 배경지식 불필요 — 개념적 사고 모델을 함께 구축합니다)
- 법률 배경지식 불필요 — 필요한 법률 개념은 상황 내에서 자연스럽게 교육합니다.
대상 수강생
- 레거 테크 분야로 전환하고자 하는 소프트웨어/AI 엔지니어
- 법률 분야에 대한 깊은 이해가 필요한 레거 테크 기업 엔지니어
- 단순히 구매하는 것이 아닌, 직접 구축하기를 원하는 기술 역량을 갖춘 법률/eDiscovery/정보 거버넌스 전문가
- '법률 엔지니어' 또는 'AI 법률 엔지니어' 직무를 목표로 하는 모든 분들
14 시간
회원 평가 (1)
저는 파이썬의 스트림릿 라이브러리에 대한 지식을 얻었으며, 확실하게 제 팀에서 R 셔니로 만든 애플리케이션들을 개선하기 위해 이를 활용해볼 것입니다.
Michal Maj - XL Catlin Services SE (AXA XL)
코스 - GitHub Copilot for Developers
기계 번역됨