이 문서에서는 AI 하이퍼컴퓨터에서 AI 워크로드의 클러스터를 만드는 방법을 요약합니다. 특히 이 문서에서는 클러스터를 시작할 때 수행할 프로세스와 선택사항을 안내합니다. 수동 평가 의 대안으로 Google Cloud 콘솔에서 Gemini에 워크로드 및 예산의 소비 옵션을 비교하도록 요청할 수 있습니다. 자세한 내용은 다음 Compute Advisor로 AI 인프라 설계를 참조하세요.
이 문서에서는 사용자가 모델 학습 및 추론과 같은 AI 및 ML 워크로드에 흔히 사용되는 용어에 익숙하다고 가정합니다. 또한 배포에 필요한 최적의 머신 유형과 용량 요구사항을 결정해야 하는 특정 AI 워크로드(예: 파운데이션 모델 사전 학습, 미세 조정 또는 추론)를 식별했다고 가정합니다.
클러스터 시작
클러스터 시작에는 다음 단계가 포함됩니다.
워크로드 결정 및 머신 유형 선택
AI 워크로드의 머신 유형을 선택합니다. AI 하이퍼컴퓨터 는 클러스터링된 GPU와 일반 GPU 모두에 대한 클러스터 생성을 지원합니다.
선택에 도움이 되도록 워크로드 요구사항을 결정하고 권장 머신 유형 및 GPU 유형과 일치시킵니다.
- 클러스터링된 GPU: 파운데이션 모델 사전 학습, 대규모 모델 미세 조정, 여러 호스트 간 추론과 같은 대규모 고성능 워크로드에 가장 적합합니다.
- 일반 GPU: 주류 추론 및 서빙, 검색 증강 생성 (RAG), 비용 효율적인 중소규모 모델 학습 및 미세 조정에 가장 적합합니다.
워크로드를 권장 머신 유형과 일치시키려면 이 표를 사용하세요.
| GPU 유형 | 워크로드 또는 사용 사례 | 권장 머신 유형 |
|---|---|---|
| 클러스터링된 GPU | 파운데이션 모델 사전 학습 및 여러 호스트 간 추론 | A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)* |
| 대규모 모델 학습, 미세 조정, 추론 | A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB) | |
| 주류 모델 추론 및 미세 조정 | A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB) | |
| 일반 GPU | 높은 처리량의 에지 서빙 및 추론 | A3 Edge (NVIDIA H100 80GB) |
| 고성능 단일 노드 서빙 및 소규모 미세 조정 | A2 (NVIDIA A100) | |
| 비용에 최적화된 엔트리 레벨 추론 | G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 또는 V100) | |
| 주류 추론, RAG, 중소규모 모델 학습 | G2 (NVIDIA L4) |
각 머신 시리즈에 대한 자세한 내용은 GPU 가속기 정보를 참조하세요.
소비 옵션 선택 및 용량 확보
선택한 머신 유형과 일반 GPU를 사용하는지 또는 클러스터링된 GPU를 사용하는지에 따라 GPU 리소스의 소비 옵션을 선택합니다.
일반 GPU의 소비 옵션
| 소비 옵션 | 적용 대상 | 용도 | 요청 방법 |
|---|---|---|---|
| 주문형 | 모든 일반 GPU | 보장된 용량이 필요하지 않은 워크로드 | 컴퓨팅 인스턴스 또는 클러스터를 만들고 표준 프로비저닝 모델을 지정합니다. 자세한 내용은 VM 인스턴스 만들기를 참조하세요. 도움말: 일반 GPU 용량을 확보할 가능성을 높이려면 Flex-start 또는 스팟을 사용하세요. |
| 표준 예약 및 표준 미래용 예약 | 모든 일반 GPU | 즉시 (표준 예약) 또는 특정 미래 날짜 (표준 미래용 예약)에 보장된 용량이 필요한 워크로드 | 온디맨드 예약 또는 미래용 예약 요청을 만듭니다. 자세한 내용은 용량 예약을 참조하세요. |
| Flex-start | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 최대 7일 동안 지속되는 단기 집중 클러스터가 필요한 워크로드 집중 리소스 할당 및 지원되는 머신 유형에 최대 53% 할인을 제공합니다. 그렇지 않으면 표준 주문형 요금이 적용됩니다. | Compute Engine, Cluster Director, Cluster Toolkit 또는 GKE를 사용하여 요청을 만듭니다. 리소스는 사용 가능해지는 즉시 프로비저닝됩니다 (시작 시간이 즉시가 아님). 자세한 내용은 용량 확보를 참조하세요. |
| 스팟 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 내결함성, 일괄 처리 또는 단기 워크로드 가장 큰 할인 (61% ~90%)을 제공하지만 컴퓨팅 리소스는 언제든지 선점될 수 있습니다. | 스팟 프로비저닝 모델을 사용하여 인스턴스 또는 노드 풀을 즉시 만듭니다. 자세한 내용은 용량 확보를 참조하세요. |
클러스터링된 GPU의 소비 옵션
| 소비 옵션 | 적용 대상 | 용도 | 요청 방법 |
|---|---|---|---|
| AI 하이퍼컴퓨터의 미래용 예약 | 모든 클러스터링된 GPU 및 A3 Edge 머신 유형 | 파운데이션 모델 사전 학습 또는 여러 호스트 간 파운데이션 모델 추론과 같이 장기간 안정성이 필요한 워크로드 집중 리소스 할당 및 vCPU 및 GPU에 최대 53% 할인 을 제공합니다. | 향후 시작 날짜 및 시간에 대해 Google 계정팀을 통해 용량을 요청합니다. |
| 캘린더 모드의 미래용 예약 | A4X Max 및 A4X를 제외한 모든 클러스터링된 GPU | 최대 90일 동안 실행되고 안정성이 필요한 워크로드(예: 모델 사전 학습 또는 미세 조정) 집중 리소스 할당 및 최대 53% 할인을 제공합니다. | 향후 날짜 및 시간에 대한 셀프서비스 예약 요청을 만듭니다. Google Cloud 요청을 승인해야 합니다. 자세한 내용은 용량 예약을 참조하세요. |
| Flex-start | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 최대 7일 동안 지속되는 단기 집중 클러스터가 필요한 워크로드 집중 리소스 할당 및 지원되는 머신 유형에 최대 53% 할인을 제공합니다. 그렇지 않으면 표준 주문형 요금이 적용됩니다. | Compute Engine, Cluster Director, Cluster Toolkit 또는 GKE를 사용하여 요청을 만듭니다. 리소스는 사용 가능해지는 즉시 프로비저닝됩니다 (시작 시간이 즉시가 아님). 자세한 내용은 용량 확보를 참조하세요. |
| 스팟 | A4X Max 및 A4X를 제외한 모든 GPU 머신 유형 | 내결함성, 일괄 처리 또는 단기 워크로드 가장 큰 할인 (61% ~90%)을 제공하지만 컴퓨팅 리소스는 언제든지 선점될 수 있습니다. | 스팟 프로비저닝 모델을 사용하여 인스턴스 또는 노드 풀을 즉시 만듭니다. 자세한 내용은 용량 확보를 참조하세요. |
배포 옵션 선택
클러스터 배포에 필요한 제어 수준에 따라 다음 옵션 중에서 선택합니다.
- 고도로 관리되는 배포: 관리형 서비스는 컴퓨팅, 네트워킹, 스토리지 리소스의 설정, 조정, 구성을 자동화합니다.
- 관리형 감소, 제어 기능 강화 배포: VM, 커스텀 환경, 조정 레이어를 수동으로 만들고 관리합니다.
고도로 관리됨
고도로 관리되는 배포 옵션은 컴퓨팅, 네트워킹, 스토리지 리소스의 설정 및 조정을 자동화하여 클러스터 관리의 운영 오버헤드를 줄입니다. 인프라를 배포하고 구성하려면 Cluster Director, Cluster Toolkit 또는 GKE를 사용하세요.
Cluster Director: 클러스터의 복잡한 설정 및 구성을 자동화하는 Google Cloud 제품으로, 클러스터의 컴퓨팅, 네트워킹, 스토리지 리소스를 구성하여 성능을 극대화하고 다운타임을 최소화할 수 있도록 지원합니다. Cluster Director는 클러스터 관리의 오버헤드를 피하고 대신 워크로드 실행에 집중하려는 IT 관리자 및 AI 연구원을 위해 설계되었습니다.
Cluster Toolkit: GKE 또는 Compute Engine의 클러스터 구성 및 배포를 간소화하는 Google 제공 오픈소스 도구입니다. 사전 정의된 청사진을 사용하여 Slurm이 포함된 A4 머신 유형과 같은 일반적인 구성을 배포합니다. 청사진을 수정하여 배포 및 소프트웨어 스택을 맞춤설정할 수 있습니다.
GKE: 관리형 Kubernetes 서비스이자 오픈소스 컨테이너 조정 플랫폼입니다. GKE는 자동 확장 및 고가용성과 같은 기능을 제공합니다. 또한 컨테이너화된 애플리케이션을 조정하고, 특수 하드웨어를 지원하며, Google Cloud 생태계와 호환되므로 AI 또는 ML 워크로드를 배포하고 관리하는 데 적합합니다. GKE를 직접 사용하거나 Cluster Toolkit을 사용하여 GKE 클러스터를 배포할 수 있습니다.
관리형 감소, 제어 기능 강화
클러스터와 클러스터에 설치된 소프트웨어를 더 세부적으로 제어하려면 관리형 Compute Engine 인스턴스 그룹 (MIG)을 사용하거나 인스턴스를 일괄적으로 만들어 Compute Engine 클러스터를 만듭니다. 그런 다음 인스턴스에 필요한 주요 소프트웨어를 수동으로 설치합니다.
조정자 선택
조정자는 클러스터 관리를 자동화합니다. 조정자를 사용하면 클러스터의 각 컴퓨팅 인스턴스를 관리할 필요가 없습니다. Slurm 또는 GKE와 같은 조정자는 작업 대기열, 리소스 할당, 자동 확장 (GKE의 경우) 및 기타 일상적인 클러스터 관리 작업과 같은 작업을 처리합니다.
Slurm: Slurm은 HPC, AI, 또는 ML 워크로드에 흔히 사용되는 오픈소스 조정자입니다. 관리형 Slurm 환경을 사용하려면 Cluster Director를 사용하세요. Slurm을 기본적으로 사용하려면 클러스터에 Slurm을 자동으로 설치하는 클러스터 청사진을 제공하는 Cluster Toolkit을 사용하거나 Compute Engine 클러스터에 Slurm을 수동으로 설치할 수 있습니다.
GKE: GKE는 오픈소스 컨테이너 조정 플랫폼인 Kubernetes를 기반으로 빌드된 관리형 서비스입니다. GKE는 컨테이너화된 애플리케이션을 조정하는 기능, 특수 하드웨어 지원, Google Cloud 생태계에서의 위치로 인해 AI 또는 ML 워크로드를 배포하고 관리하는 데 적합합니다. GKE를 직접 사용하거나 Cluster Toolkit을 사용하여 GKE 클러스터를 배포할 수 있습니다.
자체 조정자 가져오기: 다른 조정자를 사용하려면 Compute Engine 클러스터를 사용하세요. Compute Engine 클러스터 만들기는 가장 관리형이 적은 옵션입니다 에서 제공하는 Google Cloud. 이 옵션을 선택하면 인스턴스를 설정, 유지보수, 업데이트하는 책임이 있습니다.
시스템 이미지 선택
사용해야 하는 이미지는 사용 중인 GPU 인프라(클러스터링된 GPU 또는 일반 GPU)와 클러스터를 배포할 계획 (GKE, Slurm 또는 Compute Engine)에 따라 다릅니다. GKE 클러스터의 경우 Container-Optimized OS를 사용하세요. Compute Engine 및 Slurm 클러스터의 경우 GPU와 같은 가속기에 최적화된 시스템 이미지를 선택하세요. 또한 워크로드의 딥 러닝 소프트웨어 계층 (DLSL) 컨테이너 이미지를 선택할 수 있습니다.
자세한 내용은 AI 하이퍼컴퓨터 이미지를 검토하세요.
GKE 클러스터용 이미지
GKE 클러스터를 만들려면 Standard 모드와 Autopilot 모드 모두에 기본 컨테이너 OS 이미지를 사용하세요. 하지만 일반 모드에서는 Ubuntu와 같은 다른 사용 가능한 이미지를 사용하도록 선택할 수도 있습니다.
Cluster Toolkit을 사용하여 클러스터를 배포하는 경우 컨테이너 OS 이미지만 사용할 수 있습니다. 이러한 이미지는 클러스터 청사진에 내장된 이미지이기 때문입니다. 각 노드 이미지에 대한 자세한 내용은 GKE 문서의 노드 이미지를 참조하세요.
GKE는 NVIDIA CUDA, NCCL과 같은 패키지뿐만 아니라 PyTorch와 같은 ML 프레임워크를 설치하는 딥 러닝 소프트웨어 계층 (DLSL) 컨테이너 이미지도 제공하여 딥 러닝 워크로드에 바로 사용할 수 있는 환경을 제공합니다. 이러한 사전 빌드된 DLSL 컨테이너 이미지는 GKE 클러스터에서 원활하게 작동하도록 테스트되고 검증되었습니다.
Compute Engine 클러스터용 OS 이미지
AI 하이퍼컴퓨터는 Compute Engine을 사용하여 AI 및 ML 워크로드를 실행하는 데 최적화된 이미지를 제공합니다. 가장 익숙한 OS를 선택하세요.
- Rocky Linux 9 가속기
- Rocky Linux 8 가속기
- Ubuntu 24.04 LTS 가속기
- Ubuntu 22.04 LTS 가속기
Cluster Toolkit을 사용하는 경우 이러한 가속기 이미지는 이미 Cluster Toolkit 청사진에 번들로 제공됩니다. Cluster Toolkit은 Ubuntu LTS 가속기 OS 이미지를 확장하는 커스텀 이미지를 만들기 때문입니다.
각 OS 이미지에 대한 자세한 내용은 Compute Engine 문서의 운영체제 세부정보를 참조하세요.
클러스터 만들기
클러스터 생성 프로세스를 검토하고 워크로드에 대한 예비 결정을 내린 후 다음 옵션 중 하나를 사용하여 클러스터를 만듭니다.
- GKE 클러스터 만들기:
- Slurm 클러스터 만들기:
- VM 인스턴스 만들기 (단일, 일괄 또는 MIG)
워크로드의 스토리지 프로비저닝
성능, 비용, 스토리지 아키텍처 요구사항에 따라 프로비저닝할 스토리지 서비스를 선택합니다.