연락처 정보
 기간 14 시간 (2 일들)

코스 개요

강화 학습 입문

  • 강화 학습 개요 및 그 응용 분야
  • 지도 학습, 비지도 학습, 강화 학습 간의 차이
  • 핵심 개념: 에이전트, 환경, 보상, 정책

마코프 결정 과정(MDPs)

  • 상태, 액션, 보상, 상태 전이에 대한 이해
  • 가치 함수와 벨만 방정식
  • MDP 해결을 위한 동적 계획법

핵심 RL 알고리즘

  • 테이블러 방법: Q-Learning 및 SARSA
  • 정책 기반 방법: REINFORCE 알고리즘
  • 액터-크리틱 프레임워크 및 그 응용

딥 강화 학습

  • 딥 Q-네트워크(DQN) 입문
  • 경험 재학습(Experience replay) 및 타겟 네트워크
  • 정책 기울기 및 고급 딥 RL 방법

RL 프레임워크 및 도구

  • OpenAI Gym 및 기타 RL 환경 소개
  • PyTorch 또는 TensorFlow를 활용한 RL 모델 개발
  • RL 에이전트 훈련, 테스트, 벤치마킹

RL의 도전 과제

  • 훈련 중 탐색과 이용의 균형 잡기
  • 희소 보상 및 크레딧 어스니먼트 문제 처리
  • RL의 확장성 및 계산적 과제

실습 활동

  • Q-Learning 및 SARSA 알고리즘부터 직접 구현하기
  • OpenAI Gym에서 간단한 게임을 플레이하는 DQN 기반 에이전트 훈련
  • 맞춤형 환경에서의 성능 향상을 위한 RL 모델 파인튜닝

요약 및 다음 단계

요건

  • 머신러닝 원리 및 알고리즘에 대한 탄탄한 이해
  • Python 프로그래밍에 대한 숙련도
  • 신경망 및 딥러닝 프레임워크에 대한 친숙함

대상 독자층

  • 머신러닝 엔지니어
  • AI 전문가

참가자 수


참가자별 가격

예정된 코스

관련 카테고리