Ce document explique comment créer un cluster pour vos charges de travail d'IA sur AI Hypercomputer. Plus précisément, il vous guide tout au long du processus et vous aide à faire les bons choix lorsque vous démarrez un cluster. Au lieu d'effectuer une évaluation manuelle, vous pouvez demander à Gemini dans la Google Cloud console de comparer les options de consommation pour votre charge de travail et votre budget. Pour en savoir plus, consultez Concevoir une infrastructure d'IA avec Compute Advisor.
Dans ce document, nous partons du principe que vous connaissez la terminologie couramment utilisée pour les charges de travail d'IA et de ML, comme l'entraînement et l'inférence de modèles. Nous partons également du principe que vous avez identifié la charge de travail d'IA spécifique pour laquelle vous devez déterminer le type de machine optimal et les besoins en capacité pour votre déploiement (par exemple, le pré-entraînement, l'affinage ou l'inférence de modèles de fondation).
Démarrer un cluster
Le démarrage d'un cluster implique les étapes suivantes :
- Déterminer votre charge de travail et choisir un type de machine
- Choisir une option de consommation et obtenir de la capacité
- Choisir une option de déploiement
- Choisir un outil d'orchestration
- Choisir le système d'exploitation et l'image de cluster
- Créer votre cluster
- Provisionner le stockage pour votre charge de travail
Déterminer votre charge de travail et choisir un type de machine
Sélectionnez un type de machine pour votre charge de travail d'IA. AI Hypercomputer est compatible avec la création de clusters pour les GPU en cluster et les GPU généraux.
Pour vous aider à faire votre choix, déterminez les exigences de votre charge de travail et associez-les au type de machine et au type de GPU recommandés :
- GPU en cluster : idéal pour les charges de travail à grande échelle et hautes performances, telles que le pré-entraînement de modèles de fondation, l'affinage de grands modèles et l'inférence sur plusieurs hôtes.
- GPU généraux : idéal pour l'inférence et la mise en service classiques, la génération augmentée par récupération (RAG), ainsi que l'entraînement et l'affinage de modèles de petite à moyenne taille à moindre coût.
Pour associer votre charge de travail au type de machine recommandé, utilisez ce tableau :
| GPU type | Charge de travail ou cas d'utilisation | Types de machines recommandés |
|---|---|---|
| GPU en cluster | Pré-entraînement de modèles de fondation et inférence sur plusieurs hôtes | A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)* |
| Entraînement, affinage et inférence de grands modèles | A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go) | |
| Inférence et affinage de modèles classiques | A3 Mega (NVIDIA H100 80 Go), A3 High (NVIDIA H100 80 Go) | |
| GPU généraux | Mise en service et inférence en périphérie à haut débit | A3 Edge (NVIDIA H100 80 Go) |
| Mise en service hautes performances sur un seul nœud et affinage à petite échelle | A2 (NVIDIA A100) | |
| Inférence d'entrée de gamme à coût maîtrisé | G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 ou V100) | |
| Inférence classique, RAG, et entraînement de modèles de petite à moyenne taille | G2 (NVIDIA L4) |
Pour en savoir plus sur chaque série de machines, consultez À propos des accélérateurs GPU.
Choisir une option de consommation et obtenir de la capacité
Sélectionnez une option de consommation pour vos ressources GPU en fonction du type de machine choisi et selon que vous utilisez des GPU généraux ou des GPU en cluster.
Options de consommation pour les GPU généraux
| Option d'utilisation | Disponible pour | Application idéale | Comment faire une demande |
|---|---|---|---|
| À la demande | Tous les GPU généraux. | Charges de travail ne nécessitant pas de capacité assurée. | Créez une instance de calcul ou un cluster, puis spécifiez le modèle de provisionnement standard. Pour obtenir des instructions, consultez Créer des instances de VM. Conseil : Pour augmenter vos chances d'obtenir une capacité GPU générale, utilisez le démarrage flexible ou Spot. |
| Réservations standards et réservations futures standards | Tous les GPU généraux. | Charges de travail nécessitant une capacité assurée immédiatement (réservations standards) ou à une date future spécifique (réservations futures standards). | Créez une réservation à la demande ou une demande de réservation future. Pour obtenir des instructions, consultez Réserver de la capacité. |
| Démarrage flexible | Tous les types de machines GPU, à l'exception des A4X Max et A4X. | Charges de travail nécessitant des clusters denses et de courte durée (jusqu'à sept jours). Offre une allocation de ressources dense et une remise pouvant atteindre 53% sur les types de machines compatibles. Sinon, les tarifs à la demande standards s'appliquent. | Créez une demande à l'aide de Compute Engine, Cluster Director, Cluster Toolkit ou GKE. Les ressources sont provisionnées dès qu'elles sont disponibles (l'heure de début n'est pas immédiate). Pour obtenir des instructions, consultez Obtenir de la capacité. |
| Spot | Tous les types de machines GPU, à l'exception des A4X Max et A4X. | Charges de travail tolérantes aux pannes, par lot ou de courte durée. Offre la remise la plus importante (entre 61% et 90%), mais les ressources de calcul peuvent être préemptées à tout moment. | Créez des instances ou des pools de nœuds immédiatement à l'aide du modèle de provisionnement Spot. Pour obtenir des instructions, consultez Obtenir de la capacité. |
Options de consommation pour les GPU en cluster
| Option d'utilisation | Disponible pour | Application idéale | Comment faire une demande |
|---|---|---|---|
| Réservations futures dans AI Hypercomputer | Tous les GPU en cluster et les types de machines A3 Edge. | Charges de travail nécessitant de la stabilité pendant une période prolongée, telles que le pré-entraînement de modèles de fondation ou l'inférence de modèles de fondation sur plusieurs hôtes. Offre une allocation de ressources dense et une remise pouvant atteindre 53% sur les vCPU et les GPU. | Demandez de la capacité à l'équipe Google chargée de votre compte pour une date et une heure de début futures. |
| Réservations futures en mode Agenda | Tous les GPU en cluster à l'exception des A4X Max et A4X. | Charges de travail qui s'exécutent pendant 90 jours maximum et nécessitent de la stabilité, telles que le pré-entraînement ou l'affinage de modèles. Offre une allocation de ressources dense et une remise pouvant atteindre 53 %. | Créez une demande de réservation en libre-service pour une date et une heure futures ; Google Cloud approuvez la demande. Pour obtenir des instructions, consultez Réserver de la capacité. |
| Démarrage flexible | Tous les types de machines GPU à l'exception des A4X Max et A4X. | Charges de travail nécessitant des clusters denses et de courte durée (jusqu'à sept jours). Offre une allocation de ressources dense et une remise pouvant atteindre 53% sur les types de machines compatibles. Sinon, les tarifs à la demande standards s'appliquent. | Créez une demande à l'aide de Compute Engine, Cluster Director, Cluster Toolkit ou GKE. Les ressources sont provisionnées dès qu'elles sont disponibles (l'heure de début n'est pas immédiate). Pour obtenir des instructions, consultez Obtenir de la capacité. |
| Spot | Tous les types de machines GPU à l'exception des A4X Max et A4X. | Charges de travail tolérantes aux pannes, par lot ou de courte durée. Offre la remise la plus importante (entre 61% et 90%), mais les ressources de calcul peuvent être préemptées à tout moment. | Créez des instances ou des pools de nœuds immédiatement à l'aide du modèle de provisionnement Spot. Pour obtenir des instructions, consultez Obtenir de la capacité. |
Choisir une option de déploiement
Selon le niveau de contrôle dont vous avez besoin sur le déploiement de votre cluster, choisissez l'une des options suivantes :
- Déploiement hautement géré: les services gérés automatisent la configuration, l'orchestration et la configuration de vos ressources de calcul, de réseau et de stockage.
- Déploiement moins géré, plus de contrôle: vous créez et gérez manuellement vos VM, vos environnements personnalisés et vos couches d'orchestration.
Hautement géré
Les options de déploiement hautement gérées automatisent la configuration et l'orchestration de vos ressources de calcul, de réseau et de stockage, ce qui réduit la charge opérationnelle de la gestion des clusters. Pour déployer et configurer votre infrastructure, utilisez Cluster Director, Cluster Toolkit ou GKE.
Cluster Director : Google Cloud produit qui automatise la configuration complexe des clusters. Cette solution vous aide à configurer les ressources de calcul, de réseau et de stockage de vos clusters pour maximiser les performances et réduire les temps d'arrêt. Cluster Director est conçu pour les administrateurs informatiques et les chercheurs en IA qui souhaitent éviter la charge de gestion d'un cluster et se concentrer sur l'exécution de leurs charges de travail.
**Cluster Toolkit** : outil Open Source proposé par Google qui simplifie la configuration et le déploiement de clusters pour GKE ou Compute Engine. Vous utilisez des plans prédéfinis pour déployer des configurations courantes, telles que des types de machines A4 avec Slurm. Vous pouvez modifier les plans pour personnaliser les déploiements et votre pile logicielle.
GKE : service Kubernetes géré et plate-forme d'orchestration de conteneurs Open Source. GKE offre des fonctionnalités telles que l'autoscaling et la haute disponibilité. Il est également capable d'orchestrer des applications conteneurisées, de prendre en charge du matériel spécialisé et est compatible avec l' Google Cloud écosystème, ce qui le rend adapté au déploiement et à la gestion de charges de travail d'IA ou de ML. Vous pouvez déployer des clusters GKE directement à l'aide de GKE ou à l'aide de Cluster Toolkit.
Moins géré, plus de contrôle
Pour un contrôle plus précis de vos clusters et des logiciels installés sur ceux-ci, créez un cluster Compute Engine à l'aide de groupes d'instances gérés (MIG) Compute Engine ou en créant des instances en bloc. Ensuite, installez manuellement les logiciels clés dont vous avez besoin sur les instances.
Choisir un outil d'orchestration
Un outil d'orchestration automatise la gestion de vos clusters. Avec un outil d'orchestration, vous n'avez pas à gérer chaque instance de calcul du cluster. Un outil d'orchestration, tel que Slurm ou GKE, gère des tâches telles que la mise en file d'attente des tâches, l'allocation des ressources, l'autoscaling (dans le cas de GKE) et d'autres tâches de gestion de cluster quotidiennes.
Slurm : Slurm est un outil d'orchestration Open Source couramment utilisé pour les charges de travail HPC, d'IA, ou de ML. Pour une expérience Slurm gérée, vous pouvez utiliser Cluster Director. Pour utiliser Slurm de manière native, vous pouvez utiliser Cluster Toolkit (qui propose des plans de cluster qui installent automatiquement Slurm sur vos clusters) ou installer manuellement Slurm sur un cluster Compute Engine.
GKE : GKE est un service géré basé sur Kubernetes, une plate-forme d'orchestration de conteneurs Open Source. GKE est idéal pour déployer et gérer des charges de travail d'IA ou de ML, en raison de sa capacité à orchestrer des applications conteneurisées, de sa prise en charge de matériel spécialisé et de sa place dans l' Google Cloud écosystème. Vous pouvez déployer des clusters GKE directement à l'aide de GKE ou à l'aide de Cluster Toolkit.
Apportez votre propre outil d'orchestration : pour utiliser d'autres outils d'orchestration, utilisez des clusters Compute Engine. La création d'un cluster Compute Engine est l'option la moins gérée proposée sur Google Cloud. Ce choix signifie que vous êtes responsable de la configuration, de la maintenance et de la mise à jour de vos instances.
Choisir l'image système
L'image que vous devez utiliser dépend de l'infrastructure GPU que vous utilisez (GPU en cluster ou GPU généraux) et de la façon dont vous prévoyez de déployer vos clusters (GKE, Slurm ou Compute Engine). Pour les clusters GKE, utilisez Container-Optimized OS. Pour les clusters Compute Engine et Slurm, sélectionnez une image système optimisée pour les accélérateurs, tels que les GPU. De plus, vous pouvez sélectionner une image de conteneur DLSL (Deep Learning Software Layer) pour votre charge de travail.
Pour en savoir plus, consultez Images AI Hypercomputer.
Images pour les clusters GKE
Pour créer des clusters GKE, utilisez les images de système d'exploitation de conteneur par défaut pour les modes Standard et Autopilot. Toutefois, en mode Standard, vous pouvez également choisir d'utiliser d'autres images disponibles, comme Ubuntu.
Si vous utilisez Cluster Toolkit pour déployer votre cluster, vous ne pouvez utiliser que des images de système d'exploitation de conteneur, car ce sont les images intégrées aux plans de cluster. Pour en savoir plus sur chaque image de nœud, consultez Images denœuds dans la documentation GKE.
GKE propose également des images de conteneurs DLSL (Deep Learning Software Layer) qui installent des packages tels que NVIDIA CUDA et NCCL, ainsi que des frameworks de ML tels que PyTorch, offrant ainsi un environnement prêt à l'emploi pour les charges de travail de deep learning. Ces images de conteneurs DLSL prédéfinies sont testées et vérifiées pour fonctionner de manière transparente sur les clusters GKE.
Images d'OS pour les clusters Compute Engine
AI Hypercomputer propose des images optimisées pour l'exécution de charges de travail d'IA et de ML à l'aide de Compute Engine. Choisissez le système d'exploitation que vous connaissez le mieux :
- Accélérateur Rocky Linux 9
- Accélérateur Rocky Linux 8
- Accélérateur Ubuntu 24.04 LTS
- Accélérateur Ubuntu 22.04 LTS
Si vous utilisez Cluster Toolkit, ces images d'accélérateurs sont déjà regroupées dans les plans Cluster Toolkit, car Cluster Toolkit crée des images personnalisées qui étendent les images d'OS de l'accélérateur Ubuntu LTS.
Pour en savoir plus sur chaque image d'OS, consultez Détails des systèmes d'exploitation dans la documentation Compute Engine.
Créer votre cluster
Après avoir examiné le processus de création de cluster et pris des décisions préliminaires pour votre charge de travail, créez votre cluster à l'aide de l'une des options suivantes :
- Créer un cluster GKE :
- Créer un cluster Slurm :
- Créer des instances de VM (uniques, en bloc ou MIG)
Provisionner le stockage pour votre charge de travail
Choisissez un service de stockage à provisionner en fonction des exigences en termes de performances, de coûts et d'architecture de stockage.