Windows용 ROCm 교육 과정
ROCm은 AMD GPU를 지원하는 오픈소스 GPU 프로그래밍 플랫폼으로, CUDA 및 OpenCL과도 호환됩니다. 이 플랫폼을 통해 개발자는 하드웨어 세부사항에 직접 접근할 수 있으며 병렬 처리 과정을 완벽하게 제어할 수 있습니다. 다만 이를 위해서는 디바이스 아키텍처, 메모리 모델, 실행 모델 및 최적화 기법에 대한 충분한 이해가 요구됩니다.
Windows용 ROCm은 최근에 출시된 도구로서 일반적인 개인 및 기업 환경에서 널리 사용되는 Windows 운영체제 상에서 ROCm을 설치하고 활용할 수 있게 해줍니다. 이를 통해 사용자들은 인공지능, 게임, 그래픽 처리, 과학적 연산 등 다양한 분야에서 AMD GPU의 강력한 성능을 충분히 활용할 수 있습니다.
본 교육은 강사가 직접 진행하는 실시간 훈련(온라인 또는 오프라인)으로서 Windows 환경에서 ROCm을 설치하고 AMD GPU를 활용해 병렬 프로그래밍을 학습하려는 초급 및 중급 수준의 개발자들을 대상으로 합니다.
교육이 끝나면 참가자들은 다음 역량을 습득하게 됩니다:
- Windows 환경에서 ROCm 플랫폼, AMD GPU 및 Visual Studio Code를 포함한 개발 환경 구축하기
- GPU 상에서 벡터 덧셈 연산을 수행하고 결과값을 GPU 메모리로부터 가져오는 간단한 ROCm 프로그램 작성하기
- ROCm API를 이용해 디바이스 정보 조회, 메모리 할당 및 해제, 호스트와 디바이스 간 데이터 복사, 커널 실행 지시, 스레드 동기화 수행하기
- HIP 언어로 GPU에서 실행되는 커널을 작성하고 데이터를 처리할 수 있게 되기
- HIP의 내장 함수, 변수 및 라이브러리를 활용해 일반적인 작업들을 효율적으로 처리하기
- 글로벌, 공유, 상수, 로컬 등 ROCm 및 HIP에서 제공하는 메모리 영역을 적절히 활용해 데이터 전송과 메모리 접근 최적화하기
- 스레드, 블록, 그리드의 개념을 다루는 ROCm과 HIP 실행 모델을 활용해 병렬 처리를 효과적으로 제어하기
- ROCm Debugger와 ROCm Profiler 같은 도구를 이용해 ROCm 및 HIP 프로그램의 디버깅과 테스트 수행하기
- 데이터 결합, 캐싱, 프리페칭, 프로파일링 기법을 활용해 ROCm 및 HIP 프로그램 최적화 실현하기
교육 방식
- 상호작용형 강의와 토론 진행
- 다양한 연습 문제 및 실습 기회 제공
- 실제 실험 환경에서 직접 코드를 구현해보는 체험 중심 수업
커리큘럼 맞춤화 옵션
- 본 과정에 맞춘 특별 커리큘럼을 원하시면 저희에게 연락해주시기 바랍니다.
코스 개요
소개
- ROCm이란 무엇인가?
- HIP이란 무엇인가?
- ROCm vs CUDA vs OpenCL 비교
- ROCm과 HIP의 주요 기능 및 아키텍처 개요
- Windows용 ROCm과 Linux용 ROCm 간 차이점
설치 방법
- Windows에서 ROCm 설치 절차
- 설치 완료 여부 확인 및 디바이스 호환성 검증하기
- Windows 환경에서 ROCm 업데이트 또는 제거 방법
- 일반적인 설치 문제 해결 가이드
시작하기
- Windows 상에서 Visual Studio Code를 활용해 새로운 ROCm 프로젝트 생성하기
- 프로젝트 구조 및 관련 파일들 살펴보기
- 프로그램을 컴파일하고 실행해보기
- printf와 fprintf 함수를 사용해 출력 결과 확인하기
ROCm API 활용법
- 호스트 프로그램 내에서 ROCm API 활용하기
- 디바이스 정보 및 지원 기능 조회 방법
- 메모리 할당 및 해제 절차 수행하기
- 호스트와 디바이스 간 데이터 복사 기법 실습하기
- 커널 실행 명령 지시 및 스레드 동기화 처리하기
- 에러 및 예외 사항 대응 방법 알아보기
HIP 언어 사용법
- 디바이스용 프로그램에서 HIP 언어 활용하기
- GPU 상에서 실행되는 커널 작성 및 데이터 조작 기술 연습하기
- 데이터 타입, 한정자, 연산자, 표현식 등의 기본 문법 익히기
- HIP 내장 함수, 변수 및 라이브러리 활용 예시 살펴보기
ROCm과 HIP 메모리 모델 이해하기
- 글로벌, 공유, 상수, 로컬 등 각종 메모리 영역의 특징 및 사용법</li>
- 포인터, 배열, 텍스처, 서피스와 같은 다양한 메모리 객체 이해하기
- 읽기 전용, 쓰기 전용, 읽고 쓰기가 가능한 등 여러 접근 모드의 활용법</li>
- 메모리 일관성 유지 기제 및 동기화 방식 살펴보기
ROCm과 HIP 실행 모델 분석하기
- 스레드, 블록, 그리드 등 서로 다른 실행 단위 구조 이해하기
- hipThreadIdx_x, hipBlockIdx_x, hipBlockDim_x 같은 스레드 관련 함수 활용법</li>
- __syncthreads, __threadfence_block와 같이 블록 레벨에서 작동하는 함수 알아보기
- hipGridDim_x, hipGridSync, 협력형 그룹과 같은 그리드 단위 활용 기법 익히기
디버깅 방법
- Windows 상에서 ROCm 및 HIP 프로그램 디버깅 절차</li>
- Visual Studio Code 디버거를 이용해 변수, 중단점, 호출 스택 등을 확인하기</li>
- AMD 디바이스상의 ROCm/HIP 프로그램을 대상으로 ROCm Debugger 사용법 실습하기
- AMD 플랫폼 기반에서 ROCm Profiler 활용해 성능 측정 방법 알아보기</li>
최적화 기법</p>
- Windows 환경 내 ROCm 및 HIP 프로그램 최적화 접근 방안</li>
- 데이터 결합 기법을 이용한 메모리 전송 효율 개선 방법</li>
- 캐싱과 프리페칭 기술로 메모리 지연 현상 줄이기</li>
- 공유 메모리와 로컬 메모리를 활용해 메모리 접근 빈도 및 대역폭 최적화 시도하기</li>
- 프로파일링 도구를 이용한 실행 시간 측정 및 리소스 사용량 분석 절차 익히기</li>
요약 및 향후 학습 방향</p>
요건
- C/C++ 언어 및 병렬 프로그래밍 개념에 대한 이해
- 컴퓨터 아키텍처와 메모리 계층 구조에 대한 기초 지식
- 명령행 도구 및 코드 편집기 사용 경험
- Windows 운영체제와 PowerShell 활용 능력
대상자
- Windows 환경에서 ROCm을 설치해 AMD GPU 기반 병렬 프로그래밍을 배우고자 하는 개발자들
- 다양한 AMD 디바이스에서도 높은 성능과 확장성을 갖춘 코드를 작성하고 싶어하는 개발자들
- GPU 프로그래밍의 하위 레벨 측면을 탐구하고 자신의 코드 최적화 수준을 향상시키려는 프로그래머들
오픈 트레이닝 코스는 5명 이상의 참가자가 필요합니다.
Windows용 ROCm 교육 과정 - 예약
Windows용 ROCm 교육 과정 - 문의
Windows용 ROCm - 컨설팅 문의
예정된 코스
관련 코스
화웨이 Ascend 및 CANN을 활용한 AI 애플리케이션 개발
21 시간화웨이 Ascend는 고성능 추론 및 학습에 최적화된 AI 프로세서 제품군입니다.
본 교육 과정은 강사가 직접 지도하는 실시간 교육으로, 온라인 또는 현장에서 진행됩니다. 이 과정은 화웨이의 Ascend 플랫폼과 CANN 툴킷을 활용해 신경망 모델을 개발하고 최적화하고자 하는 중급 수준의 AI 엔지니어 및 데이터 사이언티스트를 대상으로 합니다.
교육을 마치면 참가자들은 다음과 같은 역량을 갖추게 됩니다:
- CANN 개발 환경을 설정하고 구성할 수 있습니다.
- MindSpore와 CloudMatrix 워크플로우를 이용해 AI 애플리케이션을 개발할 수 있습니다.
- 사용자 정의 연산자 및 타일링 기법을 활용해 Ascend NPU에서 성능을 최적화할 수 있습니다.
- 학습된 모델을 엣지 환경이나 클라우드에 배포할 수 있습니다.
교육 형식
- 상호작용형 강의 및 토론 방식입니다.
- 실제 예제 애플리케이션을 통해 화웨이 Ascend와 CANN 툴킷을 직접 사용해 보게 됩니다.
- 모델 설계, 학습 및 배포 과정에 중점을 둔 실습 연습도 포함됩니다.
과정 맞춤형 구성 옵션
- 고객의 인프라 환경이나 데이터셋에 맞게 교육 내용을 조정하고자 할 경우, 문의해 주시면 별도로 협의드리겠습니다.
CANN 및 Ascend AI 프로세서를 활용한 AI 모델 배포
14 시간CANN(Compute Architecture for Neural Networks)은 화웨이에서 제공하는 AI 컴퓨팅 스택으로, Ascend AI 프로세서상에 AI 모델을 효과적으로 배포하고 최적화하기 위해 사용됩니다.
이 실시간 강의식 교육 과정(온라인 또는 오프라인)은 중급 수준의 AI 개발자와 엔지니어를 대상으로 하며, CANN 툴킷과 MindSpore, TensorFlow, PyTorch와 같은 프레임워크를 활용해 훈련된 AI 모델을 Huawei Ascend 하드웨어에 효율적으로 배포하는 방법을 다룹니다.
본 교육 과정을 수료하면 참가자들은 다음 역량을 갖추게 됩니다:
- CANN의 아키텍처 및 AI 모델 배포 파이프라인에서의 역할 이해
- 다양한 프레임워크 기반의 모델을 Ascend 호환 형식으로 변환 및 조정하기
- ATC, OM 모델 변환 툴 및 MindSpore와 같은 도구를 활용해 엣지 및 클라우드 환경에서 추론 수행하기
- Ascend 하드웨어상에서의 배포 문제 진단 및 성능 최적화 방법 습득
교육 방식
- 상호작용형 강의 및 실시간 데모 시연
- CANN 도구와 Ascend 시뮬레이터 또는 실제 장비를 활용한 실습 중심 수업
- 실제 AI 모델을 기반으로 한 배포 시나리오 학습
과정 맞춤형 설정 옵션
- 본 과정을 기업 환경에 맞게 커스터마이징하려면 문의해 주시기 바랍니다.
CloudMatrix를 활용한 AI 추론 및 배포
21 시간CloudMatrix는 확장 가능하고 실제 운영 환경에 적합한 추론 파이프라인 구축을 지원하도록 설계된 화웨이의 통합형 AI 개발 및 배포 플랫폼입니다.
본 강좌는 강사가 직접 진행하는 실시간 교육으로서 온라인 또는 오프라인 형태로 제공되며, CANN 및 MindSpore와 연동하여 CloudMatrix 플랫폼을 활용해 AI 모델을 배포하고 모니터링하고자 하는 초급~중급 수준의 AI 전문가들을 대상으로 합니다.
교육 종료 시 참가자들은 다음 역량을 갖추게 됩니다:
- CloudMatrix를 이용한 모델 패키징, 배포 및 서비스 제공
- Ascend 칩셋용으로 모델을 변환하고 최적화하는 방법
- 실시간 추론 및 배치 처리를 위한 파이프라인 설정
- 실제 운영 환경에서의 배포 상태 모니터링과 성능 조정
강좌 형식
- 상호작용형 강의 및 토론
- 실제 배포 시나리오를 바탕으로 한 CloudMatrix 활용 연습
- 모델 변환, 최적화 및 확장성 향상에 초점을 둔 실습 문제
강좌 맞춤형 조정 옵션
- 귀사의 AI 인프라 환경이나 클라우드 구성을 고려하여 강좌 내용을 맞춤형으로 구성하고자 한다면 저희에게 문의해 주시기 바랍니다.
Biren AI 가속기에서의 GPU 프로그래밍
21 시간Biren AI 가속기는 대규모 학습 및 추론 작업을 지원하도록 설계된 고성능 GPU로, 인공지능 및 HPC 워크로드에 최적화되어 있습니다.
본 강의는 강사가 직접 진행하는 실시간 교육으로서 온라인 또는 오프라인 형태로 제공됩니다. 중급 수준 이상의 개발자들이 Biren 고유 GPU 기술 스택을 활용해 애플리케이션을 프로그래밍하고 최적화할 수 있도록 구성되었으며, CUDA 기반 환경과도 실질적인 비교가 가능합니다.
교육 과정을 마치면 참가자들은 다음 역량을 갖추게 됩니다:
- Biren GPU 아키텍처 및 메모리 계층 구조를 이해합니다.
- 개발 환경을 설정하고 Biren의 프로그래밍 모델을 활용할 수 있습니다.
- CUDA 스타일 코드를 Biren 플랫폼에 맞게 변환 및 최적화합니다.
- 성능 튜닝과 디버깅 기법을 실제로 적용할 수 있습니다.
강의 형식
- 상호작용형 강의 및 토론
- 샘플 GPU 워크로드를 통해 Biren SDK 활용 연습
- 코드 이식 및 성능 최적화에 중점을 둔 실습 위주 훈련
맞춤형 교육 옵션
- 고객사의 애플리케이션 스택이나 통합 요구사항에 맞는 커스터마이징된 교육을 원하시면 연락 주시기 바랍니다.
BANGPy 및 Neuware를 활용한 Cambricon MLU 개발
21 시간Cambricon MLU(Machine Learning Unit)는 엣지 환경과 데이터센터 환경에서 머신러닝 모델의 추론 및 학습에 최적화된 전용 AI 칩입니다.
본 강좌는 강사가 직접 진행하는 실시간 교육으로, 온라인 또는 현장에서 진행됩니다. Cambricon MLU 하드웨어 기반에서 BANGPy 프레임워크와 Neuware SDK를 사용해 AI 모델을 개발하고 배포하려는 중급 수준의 개발자들을 대상으로 합니다.
강좌를 마친 후 참가자들은 다음 역량을 갖추게 됩니다:
- BANGPy 및 Neuware 개발 환경을 설정하고 구성할 수 있습니다.
- Python과 C++ 기반의 모델을 Cambricon MLU용으로 개발하고 최적화할 수 있습니다.
- Neuware 런타임이 탑재된 엣지 및 데이터센터 기기에 모델을 배포할 수 있습니다.
- MLU 전용 가속 기능을 활용해 머신러닝 워크플로우를 통합할 수 있습니다.
강좌 형식
- 상호작용형 강의 및 토론이 진행됩니다.
- BANGPy와 Neuware를 활용한 실습 기반 개발 및 배포 연습도 포함됩니다.
- 최적화, 통합 및 테스트에 초점을 맞춘 지도형 연습 과제가 제공됩니다.
강좌 맞춤화 옵션
- 사용 중인 Cambricon 기기 모델이나 구체적인 활용 사례에 맞게 강좌 내용을 조정하고자 하시는 경우, 문의해 주시면 요청에 따라 구성해 드립니다.
AI 프레임워크 개발자를 위한 CANN 입문
7 시간CANN(Compute Architecture for Neural Networks)은 화웨이에서 제공하는 AI 컴퓨팅 툴킷으로, Ascend AI 프로세서상에 AI 모델을 컴파일하고 최적화하며 배포하는 데 사용됩니다.
본 강좌는 실시간 강사 지도 하에 진행되는 온라인 또는 오프라인 교육 과정으로, 초급 수준의 AI 개발자들을 대상으로 합니다. 참가자들은 CANN이 모델 훈련부터 배포까지의 전체 생명주기에서 어떤 역할을 하는지, 그리고 MindSpore, TensorFlow, PyTorch와 같은 프레임워크들과 어떻게 연동되는지를 학습하게 됩니다.
교육 종료 시점에 참가자들은 다음과 같은 능력을 갖추게 됩니다:
- CANN 툴킷의 목적 및 아키텍처를 이해합니다.
- CANN 및 MindSpore 환경을 구축할 수 있습니다.
- 간단한 AI 모델을 Ascend 하드웨어에 변환하고 배포할 수 있습니다.
- 향후 CANN 최적화나 통합 작업을 위한 기초 지식을 습득합니다.
강좌 형식
- 상호작용형 강의 및 토론 진행
- 간단한 모델 배포 실습을 포함한 핸즈온 연습
- CANN 툴체인과 프레임워크 통합 지점에 대한 단계별 설명
강좌 커스터마이징 옵션
- 본 강좌를 고객 맞춤형으로 진행하고자 하시는 경우, 문의해 주시면 일정을 조율해 드립니다.
CANN을 활용한 엣지 AI 배포
14 시간화웨이의 Ascend CANN 툴킷은 Ascend 310과 같은 엣지 디바이스에서 강력한 AI 추론 기능을 구현할 수 있도록 지원합니다. 계산 능력과 메모리가 제한적인 환경에서도 모델 컴파일, 최적화 및 배포를 위한 필수 도구들을 제공합니다.
본 강의는 강사가 직접 진행하는 라이브 교육으로서 온라인 또는 현장에서 실시되며, CANN 툴체인을 활용해 Ascend 엣지 디바이스에 모델을 배포하고 최적화하려는 중급 수준의 AI 개발자 및 시스템 통합 담당자를 대상으로 합니다.
교육 종료 시 참가자들은 다음 역량을 갖추게 됩니다:
- CANN 툴을 이용해 Ascend 310용 AI 모델을 준비 및 변환할 수 있습니다.
- MindSpore Lite와 AscendCL을 활용해 경량화된 추론 파이프라인을 구축할 수 있습니다.
- 연산 및 메모리 자원이 제한적인 환경에서 모델 성능을 최적화할 수 있습니다.
- 실제 엣지 환경에서 AI 애플리케이션을 배포하고 모니터링할 수 있습니다.
강의 형식
- 상호작용형 강의 및 시연
- 엣지 환경에 특화된 모델과 시나리오를 활용한 실습
- 가상 또는 물리적 엣지 하드웨어에서의 실시간 배포 예제
강의 맞춤형 설정 옵션
- 본 과정에 대한 맞춤형 교육을 원하시는 경우, 문의해 주시면 일정을 조율해 드립니다.
화웨이 AI 컴퓨팅 스택 이해하기: CANN부터 MindSpore까지
14 시간화웨이의 AI 스택은 하위 레벨의 CANN SDK부터 상위 레벨의 MindSpore 프레임워크에 이르기까지, Ascend 하드웨어 환경에 최적화된 통합형 AI 개발 및 배포 솔루션을 제공합니다.
본 강좌는 온라인 또는 오프라인으로 진행되는 실시간 교육 과정으로, CANN과 MindSpore가 어떻게 연동되어 AI 라이프사이클 관리와 인프라 설계를 지원하는지 배우고자 하는 초급 및 중급 수준의 기술 전문가들을 대상으로 합니다.
강좌 종료 시 참가자들은 다음을 할 수 있게 됩니다:
- 화웨이 AI 컴퓨팅 스택의 계층적 아키텍처를 이해할 수 있습니다.
- CANN이 모델 최적화 및 하드웨어 단계에서의 배포에 어떻게 기여하는지 파악할 수 있습니다.
- 산업계의 다른 프레임워크들과 비교하여 MindSpore와 관련 툴체인을 평가할 수 있습니다.
- 기업 환경이나 클라우드/온프레미스 인프라에서 화웨이 AI 스택을 적용하는 방안을 제시할 수 있습니다.
강좌 진행 방식
- 상호작용형 강의 및 토론
- 실시간 시스템 시연과 사례 기반 설명
- MindSpore에서 CANN으로 이어지는 모델 처리 과정을 직접 체험해볼 수 있는 선택형 실습도 제공됩니다.
강좌 맞춤형 설정 옵션
- 본 강좌에 대한 맞춤형 교육이 필요하시면 저희에게 연락하여 일정을 협의해 주십시오.
CANN SDK를 활용한 신경망 성능 최적화
14 시간CANN SDK(Neural Networks용 컴퓨팅 아키텍처)는 화웨이가 제공하는 AI 컴퓨팅 기반 솔루션으로, 개발자들이 Ascend AI 프로세서에서 구동되는 신경망 모델의 성능을 세밀하게 조정하고 최적화할 수 있도록 지원합니다.
본 교육 과정은 온라인 또는 오프라인 방식으로 진행되며, Graph Engine, TIK 및 커스텀 연산자 개발 등 CANN의 고급 도구들을 활용해 추론 성능을 향상시키고자 하는 상급 수준의 AI 개발자 및 시스템 엔지니어를 대상으로 합니다.
교육 종료 후 참가자들은 다음 역량을 습득하게 됩니다:
- CANN의 런타임 아키텍처 및 성능 관리 주기에 대한 이해
- 프로파일링 도구와 Graph Engine을 활용한 성능 분석 및 최적화 실습
- TIK 및 TVM을 이용해 커스텀 연산자를 설계하고 최적화하는 방법
- 메모리 병목 현상을 해결하여 모델 처리 속도를 향상시키는 기술
교육 방식
- 상호작용형 강의와 토론 활용
- 실시간 프로파일링 및 연산자 튜닝이 포함된 실습 위주 과정
- 엣지 환경에서의 배포 사례를 기반으로 한 최적화 훈련
교육 맞춤형 서비스
- 본 과정에 대한 맞춤형 교육을 원하시는 경우, 요청 시 조율해드립니다.
컴퓨터 비전 및 NLP 파이프라인을 위한 CANN SDK
14 시간CANN SDK(신경망용 컴퓨팅 아키텍처)는 특히 화웨이 Ascend 하드웨어 환경에서 컴퓨터 비전 및 NLP 분야의 실시간 AI 애플리케이션을 구축하고 최적화하기 위한 강력한 도구를 제공합니다.
본 교육 과정은 강사가 직접 진행하는 라이브 강좌(온라인 또는 오프라인)로, CANN SDK를 활용해 실제 비즈니스 환경에서 시각 및 언어 모델을 구축·배포·최적화하고자 하는 중급 수준의 AI 전문가들을 대상으로 합니다.
교육이 끝날 때까지 참가자들은 다음과 같은 역량을 습득하게 됩니다:
- CANN 및 AscendCL를 활용해 컴퓨터 비전 및 NLP 모델을 배포하고 최적화할 수 있습니다.
- CANN 도구를 이용해 모델을 변환한 후 실제 운영 파이프라인에 통합할 수 있습니다.
- 물체 감지, 분류, 감성 분석 등의 작업에서 추론 성능을 최적화할 수 있습니다.
- 엣지 환경이나 클라우드 기반 시나리오에서 실시간 컴퓨터 비전/NLP 파이프라인을 구축할 수 있습니다.
교육 방식
- 상호작용형 강의 및 시연이 진행됩니다.
- 모델 배포 및 성능 분석 실습도 병행됩니다.
- 실제 컴퓨터 비전/NLP 활용 사례를 기반으로 파이프라인 설계 연습도 이루어집니다.
맞춤형 교육 요청 방법
- 본 과정에 맞는 맞춤형 교육을 원하시면 문의해주시기 바랍니다.
CANN TIK 및 TVM을 활용한 맞춤형 AI 연산자 개발
14 시간CANN TIK(Tensor Instruction Kernel)와 Apache TVM은 화웨이 Ascend 하드웨어를 위한 AI 모델 연산자의 최적화 및 커스터마이징을 가능하게 합니다.
본 교육 과정은 온라인 또는 현장에서 진행되며, CANN의 TIK 프로그래밍 모델과 TVM 컴파일러 통합 기능을 활용하여 AI 모델용 맞춤형 연산자를 구축·배포·튜닝하고자 하는 고급 수준의 시스템 개발자를 대상으로 합니다.
교육 종료 후 참가자는 다음 역량을 습득하게 됩니다:
- Ascend 프로세서용 TIK DSL을 활용하여 맞춤형 AI 연산자를 작성하고 테스트하기
- 커스텀 연산자를 CANN 런타임 및 실행 그래프에 통합시키기
- TVM을 활용하여 연산자 스케줄링, 자동 튜닝 및 벤치마킹 수행하기
- 특정 계산 패턴에 최적화된 성능을 얻기 위해 명령어 레벨에서 디버깅 및 최적화 실시하기
교육 형식
- 참여형 강의 및 시연
- TIK와 TVM 파이프라인을 활용한 실습 중심의 연산자 코딩
- Ascend 하드웨어 또는 시뮬레이터 환경에서 테스트 및 성능 튜닝
교육 과정 커스터마이징 옵션
- 본 교육 과정을 개인 또는 기업의 요구사항에 맞게 커스터마이징하고자 하시는 경우, 연락주시면 협의드리겠습니다.
CUDA 애플리케이션을 중국산 GPU 아키텍처로 이식하기
21 시간화웨이 Ascend, 비렌, 캄브리콘 MLU와 같은 중국산 GPU 아키텍처들은 현지 AI 및 HPC 시장에 맞춰 설계된 CUDA 대체 솔루션을 제공합니다.
본 교육은 강사가 직접 진행하는 실시간 교육으로, 온라인 또는 오프라인 형태로 진행됩니다. 이미 존재하는 CUDA 애플리케이션을 중국산 하드웨어 플랫폼에서 사용 및 최적화하고자 하는 고급 수준의 GPU 프로그래머와 인프라 전문가들을 대상으로 합니다.
이 교육을 이수하면 참가자는 다음과 같은 역량을 갖추게 됩니다:
- 기존 CUDA 기반 워크로드가 중국산 칩 솔루션들과 얼마나 호환되는지 평가할 수 있습니다.
- 화웨이 CANN, 비렌 SDK, 캄브리콘 BANGPy 환경으로 CUDA 코드베이스를 이식할 수 있습니다.
- 여러 플랫폼 간 성능을 비교하고 최적화 포인트를 파악할 수 있습니다.
- 다양한 아키텍처 간 지원 및 배포 과정에서 발생하는 실질적인 문제들을 해결할 수 있습니다.
강의 형식
- 상호작용형 강의와 토론이 이루어집니다.
- 실습 중심의 코드 변환 및 성능 비교 실험이 진행됩니다.
- 멀티 GPU 환경에 맞춘 적응 전략을 배우는 연습도 포함됩니다.
강의 맞춤화 옵션
- 귀사의 플랫폼 또는 CUDA 프로젝트에 맞춰 교육 내용을 조정하고자 하실 경우, 저희에게 문의해 주시면 요청에 따라 커스터마이징이 가능합니다.
화웨이 Ascend, Biren 및 Cambricon에서의 성능 최적화
21 시간화웨이 Ascend, Biren, Cambricon은 중국 내 대표적인 AI 하드웨어 플랫폼으로서 각각 생산 규모에 맞는 AI 워크로드를 처리하기 위한 고유한 가속 및 성능 분석 도구들을 제공합니다.
이 강사 주도형 실시간 교육 과정(온라인 또는 현장 진행)은 여러 중국산 AI 칩 플랫폼에서 모델 추론 및 학습 워크플로우를 최적화하고자 하는 숙련된 수준의 AI 인프라 엔지니어와 성능 전문가들을 대상으로 합니다.
본 교육을 이수한 후 참가자들은 다음과 같은 역량을 갖추게 됩니다:
- Ascend, Biren, Cambricon 플랫폼에서 모델 성능 벤치마크 수행
- 시스템 병목 현상 및 메모리·연산 효율성 문제 식별
- 그래프 단계, 커널 단계, 연산자 단계의 최적화 기법 적용
- 처리량과 지연 시간을 개선하기 위한 배포 파이프라인 조정
교육 방식
- 상호작용형 강의 및 토론 진행
- 각 플랫폼별 성능 분석 및 최적화 도구를 실제로 활용해 보기
- 실제 환경에서의 튜닝 시나리오에 초점을 둔 연습 문제 제공
과정 맞춤형 옵션
- 고객사의 성능 환경이나 사용 중인 모델 유형에 따라 교육 내용을 맞춤 설계하고자 할 경우, 문의해 주시면 일정을 협의드리겠습니다.