컴퓨팅 옵션 선택

이 문서에서는 핵심 컴퓨팅 옵션을 비교하여 Google Cloud 애플리케이션의 아키텍처, 확장, 기타 요구사항에 가장 적합한 솔루션 또는 도구를 선택하는 데 도움을 드립니다.

Google Cloud에서 워크로드를 배포하려면 인프라에 대한 제어와 Google의 자동 관리가 균형을 이루는 다양한 솔루션 또는 도구 중에서 선택할 수 있습니다. 선택하는 컴퓨팅 옵션은 성능, 비용, 일일 유지보수 노력에 큰 영향을 미칠 수 있습니다. 옵션을 선택하기 전에 이러한 옵션을 더 잘 이해하려면 Google 컴퓨팅 개요를 참조하세요.

컴퓨팅 옵션 선택

워크로드에 가장 적합한 컴퓨팅 솔루션 또는 도구는 여러 요인에 따라 달라질 수 있습니다. 예를 들어 VMware 환경을 Google Cloud로 마이그레이션하려면 VMware Engine을 사용하세요.

인프라 관리, 컨테이너, Compute Engine 인스턴스 간의 절충점을 파악하려면 다음 순서도를 사용하세요. 컴퓨팅 옵션 간의 기능을 빠르게 비교하려면 이 문서의 비교 표를 참조하세요.

 Google Cloud에서 컴퓨팅 옵션을 선택하는 데 도움이 되는 플로우 차트

이전 순서도의 질문은 다음과 같습니다.

  1. Google에서 모든 인프라를 관리하도록 하시겠어요?

  2. 워크로드에 클러스터 조정 (예: Kubernetes 또는 Slurm)을 사용하시겠어요?

    • : 질문 4로 건너뜁니다.

    • 아니요: 질문 3으로 이동합니다.

  3. VM 또는 베어메탈 인스턴스를 직접 관리하시겠어요?

  4. 표준 컨테이너화된 애플리케이션 (예: 마이크로서비스 또는 API)을 실행하시겠어요?

  5. Google에서 클러스터 수명 주기를 관리하도록 하시겠어요?

Batch 사용

비동기 데이터 분석, 동영상 변환 작업, 과학 시뮬레이션과 같은 워크로드에 Batch를 선택합니다. Batch를 사용하면 Google에서 인프라를 관리하므로 일괄 컴퓨팅 작업을 예약하고, 큐에 추가하고, 실행할 수 있습니다. Google Cloud서버를 직접 배포하거나 관리할 필요가 없습니다. 대신 실행 가능한 스크립트 또는 컨테이너화된 워크로드를 작업 큐에 제출합니다.

Batch는 다음과 같은 기능을 제공합니다.

  • 가속기 지원: Batch는 높은 처리량이 필요한 일괄 처리 및 고성능 컴퓨팅 (HPC) 워크로드에 최대 RTX PRO 6000의 NVIDIA GPU를 지원합니다. Batch는 Google TPU를 지원하지 않습니다.

  • OS 및 커널 제어: Google은 작업의 OS 및 실행 환경을 관리합니다.

  • 조정: 작업 큐는 작업을 예약하고 오류가 발생하면 작업을 재시도합니다. 용량을 확장하기 위해 서비스는 큐에 추가된 작업 수를 기준으로 VM을 프로비저닝하고 시작하며 이러한 작업이 완료되면 VM을 중지합니다.

자세한 내용은 Batch 시작하기를 참조하세요.

Cloud Run 사용

서버 관리 없이 컨테이너화된 웹 애플리케이션 또는 작업을 배포하려면 Cloud Run을 선택합니다. Cloud Run은 서버 또는 클러스터 관리 없이 컨테이너화된 애플리케이션을 실행할 수 있는 서버리스 플랫폼입니다. Google은 OS, 커널, 네트워크 설정, 용량 관리를 비롯한 모든 인프라 관리를 처리합니다.

Cloud Run은 다음과 같은 기능을 제공합니다.

  • 가속기 지원: Cloud Run은 NVIDIA RTX PRO 6000 Blackwell 및 L4 GPU를 지원합니다. Cloud Run은 다른 GPU 모델 또는 Google TPU를 지원하지 않습니다.

  • OS 및 커널 제어: 워크로드를 컨테이너로 패키징하고 웹 서비스, 비동기 작업 또는 일괄 작업으로 실행합니다.

  • 조정: 서버리스 플랫폼인 Google은 수동 개입 없이 컨테이너 인스턴스를 시작, 실행, 확장합니다. 웹 서비스의 경우 Cloud Run은 수신 요청 또는 CPU 사용량을 기준으로 컨테이너 인스턴스를 추가하거나 삭제합니다.

자세한 내용은 Cloud Run이란 무엇인가요?를 참조하세요.

Cluster Director 사용

네트워크 설정 또는 클러스터 OS 구성 작업 없이 Slurm에서 예약한 AI 모델을 학습시키거나 시뮬레이션 작업을 실행하려면 Cluster Director를 선택합니다. Cluster Director는 AI, ML, HPC 클러스터의 배포 및 수명 주기 관리를 자동화하는 관리형 서비스입니다.

Cluster Director는 다음과 같은 기능을 제공합니다.

  • 가속기 지원: Cluster Director는 AI, ML, HPC 워크로드에 GB300 Ultra Superchips, GB200 Superchips, B200, H200, 및 H100을 비롯한 NVIDIA GPU를 지원합니다. Cluster Director는 Google TPU를 지원하지 않습니다.

  • OS 및 커널 제어: Google은 클러스터 수명 주기를 관리하고 ML용으로 설계된 커스텀 Ubuntu OS를 설정합니다. 이 서비스는 로그인 노드, 컴퓨팅 노드 집합, AI 워크로드용으로 빌드된 배포 템플릿이 포함된 즉시 사용 가능한 환경을 제공합니다.

  • 조정: 용량을 확장하기 위해 Slurm은 CPU 사용량이 증가하면 노드를 만들고 불필요한 요금이 청구되지 않도록 일정 기간 동안 유휴 상태로 유지되면 노드를 삭제합니다.

자세한 내용은 Cluster Director 개요를 참조하세요.

Cluster Toolkit 사용

OS 및 소프트웨어 스택에 대한 관리 제어를 유지하면서 자동 배포 템플릿을 사용하려면 Cluster Toolkit을 선택합니다. Cluster Toolkit은에서 AI, ML, HPC 클러스터를 프로비저닝 하고 구성하는 데 사용되는 오픈소스 도구입니다. Google Cloud

Cluster Toolkit은 다음과 같은 기능을 제공합니다.

  • 가속기 지원: Cluster Toolkit은 NVIDIA GPU 및 Google TPU를 지원하며, 이는 블루프린트라는 배포 템플릿으로 프로비저닝하고 구성합니다. 이러한 자동 구성 파일을 사용하면 코드형 인프라 (IaC) 원칙에 따라 표준화되고 반복 가능한 클러스터 인프라를 배포할 수 있습니다.

  • OS 및 커널 제어: Cluster Toolkit은 프로젝트 내에 컴퓨팅 인스턴스 또는 GKE 리소스를 배포합니다. Google Cloud 이러한 리소스를 배포한 후에는 OS, 소프트웨어 설정, 클러스터 수명 주기에 대한 관리 제어를 유지합니다.

  • 조정: 용량을 확장하기 위해 템플릿 설정을 기준으로 노드를 추가하거나 삭제하도록 관리형 인스턴스 그룹 (MIG) 또는 GKE 도구를 구성합니다.

자세한 내용은 Cluster Toolkit 개요를 참조하세요.

Compute Engine 사용

애플리케이션에 커스텀 아키텍처 구성, 특수 커널 설정 또는 가상 서버에 대한 관리 제어가 필요한 경우 Compute Engine을 선택합니다. Compute Engine은 Google Cloud's 핵심 Infrastructure as a Service (IaaS) 플랫폼으로, Google's 물리적 하드웨어에서 VM 및 베어메탈 인스턴스를 만들고 실행할 수 있습니다.

Compute Engine은 다음과 같은 기능을 제공합니다.

  • 가속기 지원: Compute Engine은 컴퓨팅 인스턴스에 연결하는 NVIDIA GPU 및 Google TPU를 지원합니다.

  • OS 및 커널 제어: OS, 커널 설정, 부팅 파일을 완벽하게 제어하고 CPU 프로세서, 메모리 구성, 스토리지 유형, 게스트 OS를 선택합니다.

  • 조정: 조정은 수동이므로 안정성을 위해 자체 컴퓨팅 인스턴스, 네트워크 규칙, 트래픽 경로, 백업 시스템을 설정하고 관리합니다. 용량을 확장하려면 필요에 따라 컴퓨팅 인스턴스를 추가하거나 삭제하고, 커스텀 도구를 사용하거나, MIG를 구성하여 클러스터 용량을 조정합니다.

자세한 내용은 Compute Engine 개요를 참조하세요.

GKE 사용

분산 애플리케이션 또는 범용 마이크로서비스에 강력한 컨테이너 기반 조정 플랫폼이 필요한 경우 Google Kubernetes Engine (GKE)을 선택합니다. GKE는 컨테이너화된 애플리케이션을 배포, 확장, 조정하는 업계 표준 관리형 Kubernetes 플랫폼입니다. Google은 보안 및 시스템 가용성을 위해 Kubernetes 제어 영역을 관리합니다.

GKE는 다음과 같은 기능을 제공합니다.

  • 가속기 지원: GKE는 컨테이너화된 워크로드에 NVIDIA GPU 및 Google TPU를 지원합니다.

  • OS 및 커널 제어: Google은 Autopilot 모드와 Standard 모드 모두에서 OS를 관리합니다. Autopilot 모드에서 Google은 수동 개입 없이 클러스터 노드 및 용량 조정을 관리합니다. 일반 모드에서는 클러스터 노드 풀을 관리합니다.

  • 조정: 수요 변화에 따라 용량을 조정하기 위해 GKE 는 수평형 및 수직형 포드 자동 확장 처리 (HPA 및 VPA)를 사용하여 컨테이너를 추가하거나 삭제하고 클러스터 자동 확장 처리를 사용하여 노드를 추가하거나 삭제합니다. 또한 GKE는 Kueue를 통해 일괄 작업을 조정합니다.

자세한 내용은 GKE 개요를 참조하세요.

VMware Engine 사용

최소한의 운영 변경사항으로 온프레미스 VMware 워크로드를 인프라로 Google Cloud 마이그레이션하려면 VMware Engine을 선택합니다. VMware Engine은 애플리케이션 수정 없이 Google 하드웨어에서 VMware 가상 머신을 실행할 수 있는 관리형 서비스입니다.

VMware Engine은 다음과 같은 기능을 제공합니다.

  • 가속기 지원: VMware Engine은 GPU 또는 TPU를 지원하지 않습니다.

  • OS 및 커널 제어: 기존 설정에서 실행되는 대로 Google Cloud 에서 VMware 애플리케이션을 실행합니다. Google은 vSphere, vCenter, vSAN, NSX-T와 같은 물리적 하드웨어, 네트워크 인프라, VMware 소프트웨어 플랫폼을 관리합니다. VM, 게스트 OS, VMware 관리 도구에 대한 관리 제어를 유지합니다.

  • 조정: 프라이빗 클라우드의 크기를 조정하려면 전용 ESXi 노드를 추가하거나 삭제합니다.

자세한 내용은 Google Cloud VMware Engine 개요를 참조하세요.

컴퓨팅 옵션 비교

워크로드에 적합한 컴퓨팅 솔루션 또는 도구를 식별하려면 다음 표에서 컴퓨팅 옵션 간의 기술 기능을 비교하세요.

컴퓨팅 옵션 GPU TPU OS 및 커널 제어 조정 확장
일괄 최대 NVIDIA RTX PRO 6000 아니요 Google 관리 작업 큐 큐에 추가된 작업을 기준으로 자동
Cloud Run NVIDIA RTX PRO 6000 Blackwell 및 L4 아니요 Google 관리 서버리스 요청 또는 CPU 사용량을 기준으로 자동
Cluster Director NVIDIA GB300 Ultra Superchips, GB200 Superchips, B200, H200, H100 아니요 Google 관리 (커스텀 Ubuntu) Slurm CPU 사용량을 기준으로 자동
Cluster Toolkit 사용 가능한 모든 NVIDIA GPU 사용 가능한 모든 Google TPU 자체 관리형 자동 구성 파일 (IaC) MIG 또는 GKE 도구를 사용하여 맞춤설정 가능
Compute Engine 사용 가능한 모든 NVIDIA GPU 사용 가능한 모든 Google TPU 자체 관리형 수동 MIG를 사용하여 수동 또는 자동
Google Kubernetes Engine (GKE) 사용 가능한 모든 NVIDIA GPU 사용 가능한 모든 Google TPU Google 관리 (Autopilot) 또는 반관리 (Standard) Kubernetes 자동 포드 및 노드 확장
VMware Engine 아니요 아니요 Google 관리 VMware 플랫폼 ESXi 노드를 사용하여 수동

AI 및 ML용 AI 하이퍼컴퓨터 기능 살펴보기

AI 하이퍼컴퓨터는 목적에 맞게 빌드된 하드웨어, 오픈 소프트웨어, 유연한 소비 모델을 결합한 통합 아키텍처입니다. 이 아키텍처는 ML 생산성을 높이고 까다로운 AI 워크로드에 유용한 데이터 전송률인 goodput을 극대화하도록 특별히 설계되었습니다.

AI 하이퍼컴퓨터는 다음과 같은 기능을 제공합니다.

  • 가속기 지원: AI 하이퍼컴퓨터는 모든 NVIDIA GPU 및 Google TPU를 지원합니다. 가속기는 고대역폭 네트워킹을 통해 연결되어 수천 개의 컴퓨팅 인스턴스에서 AI 모델의 처리량을 최적화합니다.

  • OS 및 커널 제어: OS 및 커널에 대한 제어는 선택한 배포 도구에 따라 다릅니다.

    • Google 관리 환경: Cluster Director 를 선택하면 Google에서 클러스터 환경과 수명 주기를 관리합니다. Autopilot 모드에서 GKE를 선택하면 Google에서 컨테이너 환경을 관리합니다.

    • 자체 관리 환경: Cluster Toolkit, Compute Engine 또는 Standard 모드에서 GKE를 선택하면 클러스터 리소스와 OS를 관리합니다.

  • 조정: 컴퓨팅 수요가 변경되면 Slurm, GKE 또는 커스텀 조정자를 사용하여 클러스터에서 컴퓨팅 인스턴스, 포드 또는 컨테이너를 추가하거나 삭제할 수 있습니다.

자세한 내용은 AI 하이퍼컴퓨터 개요를 참조하세요.