Este documento resume como criar um cluster para suas cargas de trabalho de IA no Hipercomputador de IA. Especificamente, este documento orienta você no processo e nas escolhas a serem feitas ao iniciar um cluster. Como alternativa à avaliação manual, você pode solicitar ao Gemini no Google Cloud console que compare as opções de consumo para sua carga de trabalho e orçamento. Para mais informações, consulte Projetar infraestrutura de IA com o Compute Advisor.
Este documento pressupõe que você esteja familiarizado com a terminologia usada com frequência para cargas de trabalho de IA e ML, como treinamento de modelo e inferência. Ele também pressupõe que você identificou a carga de trabalho de IA específica para a qual precisa determinar o tipo de máquina ideal e as necessidades de capacidade para sua implantação, por exemplo, pré-treinamento, ajuste fino ou inferência de modelos de fundação.
Iniciar um cluster
Para iniciar um cluster, siga estas etapas:
- Determine sua carga de trabalho e escolha um tipo de máquina
- Escolha uma opção de consumo e obtenha capacidade
- Escolha uma opção de implantação
- Escolha um orquestrador
- Escolha a imagem do sistema operacional e do cluster
- Crie o cluster
- Provisione armazenamento para sua carga de trabalho
Determine sua carga de trabalho e escolha um tipo de máquina
Selecione um tipo de máquina para sua carga de trabalho de IA. O Hipercomputador de IA oferece suporte à criação de clusters para GPUs gerais e em cluster.
Para ajudar você a escolher, determine os requisitos da carga de trabalho e combine-os com o tipo de máquina e de GPU recomendados:
- GPUs em cluster: ideais para cargas de trabalho de alto desempenho em grande escala, como pré-treinamento de modelos de fundação, ajuste fino de modelos grandes e inferência em vários hosts.
- GPUs gerais: ideais para inferência e disponibilização convencionais, geração aumentada por recuperação (RAG, na sigla em inglês) e treinamento de modelo e ajuste fino de modelos pequenos a médios econômicos.
Para combinar sua carga de trabalho com o tipo de máquina recomendado, use esta tabela:
| Tipo de GPU | Carga de trabalho ou caso de uso | Tipos de máquina recomendados |
|---|---|---|
| GPU em cluster | Pré-treinamento de modelos de fundação e inferência em vários hosts | A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)* |
| Treinamento de modelo grande, ajuste fino e inferência | A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB) | |
| Inferência e ajuste fino de modelos convencionais | A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB) | |
| GPU geral | Inferência e disponibilização de borda de alta capacidade de processamento | A3 Edge (NVIDIA H100 80GB) |
| Disponibilização de nó único de alta performance e ajuste fino em pequena escala | A2 (NVIDIA A100) | |
| Inferência de nível básico com custo otimizado | G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 ou V100) | |
| Inferência convencional, RAG e treinamento de modelo pequenos a médios | G2 (NVIDIA L4) |
Para informações detalhadas sobre cada série de máquinas, consulte Sobre aceleradores de GPU.
Escolha uma opção de consumo e obtenha capacidade
Selecione uma opção de consumo para seus recursos de GPU com base no tipo de máquina escolhido e se você usa GPUs gerais ou em cluster.
Opções de consumo para GPUs gerais
| Opção de consumo | Disponível para | Ideal para | Como solicitar |
|---|---|---|---|
| Sob demanda | Todas as GPUs gerais. | Cargas de trabalho que não exigem capacidade garantida. | Crie uma instância de computação ou cluster e especifique o modelo de provisionamento padrão. Para instruções, consulte Criar instâncias de VM. Dica: para aumentar suas chances de conseguir capacidade de GPU geral, use o início flexível ou o Spot. |
| Reservas padrão e reservas adiantadas padrão | Todas as GPUs gerais. | Cargas de trabalho que exigem capacidade garantida imediatamente (reservas padrão) ou para uma data futura específica (reservas adiantadas padrão). | Crie uma reserva imediata ou uma solicitação de reserva adiantada. Para instruções, consulte Reservar capacidade. |
| Início flexível | Todos os tipos de máquina de GPU, exceto A4X Max e A4X. | Cargas de trabalho que exigem clusters densos e de curta duração, com prazo de até sete dias. Oferece alocação de recursos densa e até 53% de desconto nos tipos de máquina compatíveis. Caso contrário, as taxas padrão sob demanda serão aplicadas. | Crie uma solicitação usando o Compute Engine, o Cluster Director, o Cluster Toolkit ou o GKE. Os recursos são provisionados assim que ficam disponíveis (o horário de início não é imediato). Para instruções, consulte Obter capacidade. |
| Spot | Todos os tipos de máquina de GPU, exceto A4X Max e A4X. | Cargas de trabalho tolerantes a falhas, em lote ou de curta duração. Oferece o maior desconto (entre 61% e 90%), mas os recursos de computação podem ser interrompidos a qualquer momento. | Crie instâncias ou pools de nós imediatamente usando o modelo de provisionamento Spot. Para instruções, consulte Obter capacidade. |
Opções de consumo para GPUs em cluster
| Opção de consumo | Disponível para | Ideal para | Como solicitar |
|---|---|---|---|
| Reservas adiantadas no Hipercomputador de IA | Todos os tipos de máquina de GPU em cluster e A3 Edge. | Cargas de trabalho que exigem estabilidade por um período prolongado, como pré-treinamento de modelos de fundação ou inferência de modelos de fundação em vários hosts. Oferece alocação de recursos densa e até 53% de desconto em vCPUs e GPUs. | Solicite capacidade à sua equipe de contas do Google para uma data e hora de início futuras. |
| Reservas adiantadas no modo calendário | Todas as GPUs em cluster exceto A4X Max e A4X. | Cargas de trabalho que são executadas por até 90 dias e exigem estabilidade, como pré-treinamento ou ajuste fino de modelos. Oferece alocação de recursos densa e até 53% de desconto. | Crie uma solicitação de reserva de autoatendimento para uma data e hora futuras; Google Cloud É necessário aprovar a solicitação. Para instruções, consulte Reservar capacidade. |
| Início flexível | Todos os tipos de máquina de GPU exceto A4X Max e A4X. | Cargas de trabalho que exigem clusters densos e de curta duração, com prazo de até sete dias. Oferece alocação de recursos densa e até 53% de desconto nos tipos de máquina compatíveis. Caso contrário, as taxas padrão sob demanda serão aplicadas. | Crie uma solicitação usando o Compute Engine, o Cluster Director, Cluster Toolkit ou o GKE. Os recursos são provisionados assim que ficam disponíveis (o horário de início não é imediato). Para instruções, consulte Obter capacidade. |
| Spot | Todos os tipos de máquina de GPU exceto A4X Max e A4X. | Cargas de trabalho tolerantes a falhas, em lote ou de curta duração. Oferece o maior desconto (entre 61% e 90%), mas os recursos de computação podem ser interrompidos a qualquer momento. | Crie instâncias ou pools de nós imediatamente usando o modelo de provisionamento Spot. Para instruções, consulte Obter capacidade. |
Escolher uma opção de implantação
Dependendo do nível de controle necessário sobre a implantação do cluster, escolha entre as seguintes opções:
- Implantação totalmente gerenciada: os serviços gerenciados automatizam a configuração, a orquestração e a configuração dos recursos de computação, rede e armazenamento.
- Implantação menos gerenciada e com mais controle: você cria e gerencia manualmente suas VMs, ambientes personalizados e camadas de orquestração.
Totalmente gerenciado
As opções de implantação totalmente gerenciadas automatizam a configuração e a orquestração dos recursos de computação, rede e armazenamento, o que reduz a sobrecarga operacional do gerenciamento de clusters. Para implantar e configurar sua infraestrutura, use o Cluster Director, o Cluster Toolkit ou o GKE.
Cluster Director: um Google Cloud produto que automatiza a configuração e a instalação complexas de clusters, ajudando você a configurar recursos de computação, rede e armazenamento para maximizar a performance e minimizar os tempos de inatividade. O Cluster Director foi projetado para administradores de TI e pesquisadores de IA que querem evitar a sobrecarga de gerenciar um cluster e, em vez disso, se concentrar na execução das cargas de trabalho.
Cluster Toolkit: uma ferramenta de código aberto oferecida pelo Google que simplifica a configuração e a implantação de clusters para o GKE ou o Compute Engine. Você usa modelos predefinidos para implantar configurações comuns, como tipos de máquina A4 com Slurm. É possível modificar modelos para personalizar implantações e sua pilha de software.
GKE: um serviço gerenciado do Kubernetes e uma plataforma de orquestração de contêineres de código aberto platform. O GKE oferece recursos como escalonamento automático e alta disponibilidade. Ele também é capaz de orquestrar aplicativos conteinerizados, oferecer suporte a hardware especializado e é compatível com o Google Cloud ecossistema, o que o torna adequado para implantar e gerenciar cargas de trabalho de IA ou ML. É possível implantar clusters do GKE usando o GKE diretamente ou o Cluster Toolkit.
Menos gerenciado, mais controle
Para ter um controle mais granular sobre seus clusters e o software instalado neles, crie um cluster do Compute Engine usando grupos de instâncias gerenciadas do Compute Engine (MIGs) ou criando instâncias em massa. Em seguida, instale manualmente qualquer software essencial necessário nas instâncias.
Escolher o orquestrador
Um orquestrador automatiza o gerenciamento dos clusters. Com um orquestrador, não é necessário gerenciar cada instância de computação no cluster. Um orquestrador, como o Slurm ou o GKE, processa tarefas como enfileiramento de jobs, alocação de recursos, escalonamento automático (no caso do GKE) e outras tarefas diárias de gerenciamento de clusters.
Slurm: o Slurm é um orquestrador de código aberto usado com frequência para cargas de trabalho de HPC, IA, ou ML. Para uma experiência gerenciada do Slurm, use o Cluster Director. Para usar o Slurm nativamente, use o Cluster Toolkit (que oferece modelos de cluster que instalam automaticamente o Slurm nos clusters) ou instale manualmente o Slurm em um cluster do Compute Engine.
GKE: o GKE é um serviço gerenciado criado no Kubernetes, uma plataforma de orquestração de contêineres de código aberto. O GKE é ideal para implantar e gerenciar cargas de trabalho de IA ou ML, devido à capacidade de orquestrar aplicativos conteinerizados, ao suporte de hardware especializado e ao lugar no Google Cloud ecossistema. É possível implantar clusters do GKE usando o GKE diretamente ou o Cluster Toolkit.
Traga seu próprio orquestrador: para usar outros orquestradores, use clusters do Compute Engine. A criação de um cluster do Compute Engine é a opção menos gerenciada oferecida no Google Cloud. Essa escolha significa que você é responsável por configurar, manter e atualizar suas instâncias.
Escolher a imagem do sistema operacional
A imagem que você precisa usar depende da infraestrutura de GPU que está usando (GPUs em cluster ou GPUs gerais) e de como você planeja implantar seus clusters (GKE, Slurm ou Compute Engine). Para clusters do GKE, use o Container-Optimized OS. Para clusters do Compute Engine e do Slurm, selecione uma imagem do sistema operacional otimizada para aceleradores, como GPUs. Além disso, você pode selecionar uma imagem de contêiner da camada de software de aprendizado profundo (DLSL, na sigla em inglês) para sua carga de trabalho.
Para informações detalhadas, consulte Imagens do Hipercomputador de IA.
Imagens para clusters do GKE
Para criar clusters do GKE, use as imagens de SO de contêiner padrão para os modos Standard e Autopilot. No entanto, no modo Standard, também é possível usar outras imagens disponíveis, como o Ubuntu.
Se você usar o Cluster Toolkit para implantar o cluster, só poderá usar imagens de SO de contêiner, já que elas são as imagens integradas aos modelos de cluster. Para mais informações sobre cada imagem de nó, consulte Imagens denó na documentação do GKE.
O GKE também oferece imagens de contêiner da camada de software de aprendizado profundo (DLSL, na sigla em inglês) que instalam pacotes como NVIDIA CUDA e NCCL, além de frameworks de ML como o PyTorch, fornecendo um ambiente pronto para uso para cargas de trabalho de aprendizado profundo. Essas imagens de contêiner DLSL pré-criadas são testadas e verificadas para funcionar perfeitamente em clusters do GKE.
Imagens de SO para clusters do Compute Engine
O Hipercomputador de IA oferece imagens otimizadas para executar cargas de trabalho de IA e ML usando o Compute Engine. Escolha o SO com que você está mais familiarizado:
- Acelerador Rocky Linux 9
- Acelerador Rocky Linux 8
- Acelerador Ubuntu 24.04 LTS
- Acelerador Ubuntu 22.04 LTS
Se você usar o Cluster Toolkit, essas imagens de acelerador já estarão agrupadas nos modelos do Cluster Toolkit, porque o Cluster Toolkit cria imagens personalizadas que estendem as imagens do SO do Ubuntu LTS Accelerator.
Para mais informações sobre cada imagem do SO, consulte Detalhes do sistema operacional na documentação do Compute Engine.
Crie o cluster
Depois de analisar o processo de criação do cluster e tomar decisões preliminares para sua carga de trabalho, crie o cluster usando uma destas opções:
- Criar um cluster do GKE:
- Criar um cluster Slurm:
- Criar instâncias de VM (únicas, em massa ou MIGs)
Provisione armazenamento para sua carga de trabalho
Escolha um serviço de armazenamento para provisionar, com base nos requisitos de performance, custo e arquitetura de armazenamento.