Planifica y crea tu infraestructura de IA

En este documento, se resume cómo crear un clúster para tus cargas de trabajo de IA en AI Hypercomputer. En particular, este documento te guía por el proceso y las decisiones que debes tomar cuando inicias un clúster. Como alternativa a la evaluación manual, puedes solicitarle a Gemini en la Google Cloud consola que compare las opciones de consumo para tu carga de trabajo y presupuesto. Para obtener más información, consulta Diseña la infraestructura de IA con Compute Advisor.

En este documento, se supone que estás familiarizado con la terminología de uso común para las cargas de trabajo de IA y AA, como el entrenamiento y la inferencia de modelos. También se supone que identificaste la carga de trabajo de IA específica para la que necesitas determinar el tipo de máquina y las necesidades de capacidad óptimos para tu implementación, por ejemplo, el entrenamiento previo, el ajuste o la inferencia de modelos de base.

Iniciar un clúster

Para iniciar un clúster, debes seguir estos pasos:

  1. Determina tu carga de trabajo y elige un tipo de máquina
  2. Elige una opción de consumo y obtén capacidad
  3. Elige una opción de implementación
  4. Elige un organizador
  5. Elige el sistema operativo y la imagen del clúster
  6. Crea tu clúster
  7. Aprovisiona almacenamiento para tu carga de trabajo

Determina tu carga de trabajo y elige un tipo de máquina

Selecciona un tipo de máquina para tu carga de trabajo de IA. AI Hypercomputer admite la creación de clústeres para GPU en clúster y GPU generales.

Para ayudarte a elegir, determina los requisitos de tu carga de trabajo y hazlos coincidir con el tipo de máquina y el tipo de GPU recomendados:

  • GPU en clúster: Ideal para cargas de trabajo de alto rendimiento y a gran escala, como el entrenamiento previo de modelos de base, el ajuste de modelos grandes y la inferencia en varios hosts.
  • GPU generales: Ideal para la inferencia y la entrega convencionales, la generación aumentada por recuperación (RAG) y el entrenamiento y ajuste de modelos pequeños a medianos rentables.

Para hacer coincidir tu carga de trabajo con el tipo de máquina recomendado, usa esta tabla:

Tipo de GPU Carga de trabajo o caso de uso Tipos de máquinas recomendados
GPU en clúster Entrenamiento previo de modelos de base e inferencia en varios hosts A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)*
Entrenamiento, ajuste e inferencia de modelos grandes A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB)
Inferencia y ajuste de modelos convencionales A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB)
GPU general Inferencia y entrega perimetral de alta capacidad de procesamiento A3 Edge (NVIDIA H100 80GB)
Entrega de un solo nodo de alto rendimiento y ajuste a pequeña escala A2 (NVIDIA A100)
Inferencia de nivel de entrada con optimización de costos G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 o V100)
Inferencia convencional, RAG y entrenamiento de modelos pequeños a medianos G2 (NVIDIA L4)

Para obtener información detallada sobre cada serie de máquinas, consulta Acerca de los aceleradores de GPU.

Elige una opción de consumo y obtén capacidad

Elige una opción de consumo para tus recursos de GPU según el tipo de máquina elegido y si usas GPU generales o GPU en clúster.

Opciones de consumo para GPU generales

Opción de consumo Disponible para Ideal para Cómo hacer una solicitud
A pedido Todas las GPU generales. Cargas de trabajo que no requieren capacidad garantizada Crea una instancia o un clúster de procesamiento y especifica el modelo de aprovisionamiento estándar. Para obtener instrucciones, consulta Crea instancias de VM.

Sugerencia: Para aumentar tus posibilidades de obtener capacidad de GPU general, usa Inicio flexible o Spot.
Reservas estándar y reservas futuras estándar Todas las GPU generales. Cargas de trabajo que requieren capacidad garantizada de inmediato (reservas estándar) o para una fecha futura específica (reservas futuras estándar) Crea una reserva según demanda o una solicitud de reserva futura. Para obtener instrucciones, consulta Reserva capacidad.
Inicio flexible Todos los tipos de máquinas de GPU, excepto A4X Max y A4X Cargas de trabajo que requieren clústeres densos y de corta duración que duran hasta siete días Ofrece asignación de recursos densa y hasta un 53% de descuento en los tipos de máquinas compatibles; de lo contrario, se aplican las tarifas estándar a pedido Crea una solicitud con Compute Engine, Cluster Director, Cluster Toolkit o GKE. Los recursos se aprovisionan en cuanto están disponibles (la hora de inicio no es inmediata). Para obtener instrucciones, consulta Obtén capacidad.
Spot Todos los tipos de máquinas de GPU, excepto A4X Max y A4X. Cargas de trabajo tolerantes a errores, por lotes o de corta duración Ofrece el mayor descuento (entre el 61% y el 90%), pero los recursos de procesamiento se pueden quitar en cualquier momento Crea instancias o grupos de nodos de inmediato con el modelo de aprovisionamiento Spot. Para obtener instrucciones, consulta Obtén capacidad.

Opciones de consumo para GPU en clúster

Opción de consumo Disponible para Ideal para Cómo hacer una solicitud
Reservas futuras en AI Hypercomputer Todos los tipos de máquinas de GPU en clúster y A3 Edge Cargas de trabajo que requieren estabilidad durante un período prolongado, como el entrenamiento previo de modelos de base o la inferencia de modelos de base en varios hosts. Ofrece asignación de recursos densa y hasta un 53% de descuento para CPU virtuales y GPU Solicita capacidad a través de tu equipo de Cuentas de Google para una fecha y hora de inicio futuras.
Reservas futuras en modo calendario Todas las GPU en clúster excepto A4X Max y A4X. Cargas de trabajo que se ejecutan hasta por 90 días y requieren estabilidad, como el entrenamiento previo o el ajuste de modelos Ofrece asignación de recursos densa y hasta un 53% de descuento. Crea una solicitud de reserva de autoservicio para una fecha y hora futuras; Google Cloud debes aprobar la solicitud. Para obtener instrucciones, consulta Reserva capacidad.
Inicio flexible Todos los tipos de máquinas de GPU excepto A4X Max y A4X. Cargas de trabajo que requieren clústeres densos y de corta duración que duran hasta siete días. Ofrece asignación de recursos densa y hasta un 53% de descuento en los tipos de máquinas compatibles; de lo contrario, se aplican las tarifas estándar a pedido Crea una solicitud con Compute Engine, Cluster Director, Cluster Toolkit o GKE. Los recursos se aprovisionan en cuanto están disponibles (la hora de inicio no es inmediata). Para instrucciones, consulta Obtén capacidad.
Spot Todos los tipos de máquinas de GPU excepto A4X Max y A4X. Cargas de trabajo tolerantes a errores, por lotes o de corta duración Ofrece el mayor descuento (entre el 61% y el 90%), pero los recursos de procesamiento se pueden quitar en cualquier momento Crea instancias o grupos de nodos de inmediato con el modelo de aprovisionamiento Spot. Para obtener instrucciones, consulta Obtén capacidad.

Elige una opción de implementación

Según el nivel de control que necesites sobre la implementación de tu clúster, elige entre las siguientes opciones:

Altamente administrado

Las opciones de implementación altamente administradas automatizan la configuración y la organización de tus recursos de procesamiento, redes y almacenamiento, lo que reduce la sobrecarga operativa de la administración de clústeres. Para implementar y configurar tu infraestructura, usa Cluster Director, Cluster Toolkit o GKE.

  • Cluster Director: Es un Google Cloud producto que automatiza la compleja configuración de los clústeres, lo que te ayuda a configurar los recursos de procesamiento, redes y almacenamiento para tus clústeres y, así, maximizar el rendimiento y minimizar los tiempos de inactividad. Cluster Director está diseñado para administradores de TI y investigadores de IA que desean evitar la sobrecarga de administrar un clúster y, en cambio, enfocarse en ejecutar sus cargas de trabajo.

  • Cluster Toolkit: Es una herramienta de código abierto que ofrece Google y que simplifica la configuración y la implementación de clústeres para GKE o Compute Engine. Usas planos predefinidos para implementar configuraciones comunes, como tipos de máquinas A4 con Slurm. Puedes modificar los planos para personalizar las implementaciones y tu pila de software.

  • GKE: Es un servicio administrado de Kubernetes y una plataforma de organización de contenedores de código abierto. GKE ofrece funciones como el ajuste de escala automático y la alta disponibilidad. También puede organizar aplicaciones alojadas en contenedores, admitir hardware especializado y es compatible con el Google Cloud ecosistema, lo que lo hace adecuado para implementar y administrar cargas de trabajo de IA o AA. Puedes implementar clústeres de GKE directamente o con Cluster Toolkit.

Menos administrado y con más control

Para obtener un control más detallado sobre tus clústeres y el software instalado en ellos, crea un clúster de Compute Engine con grupos de instancias administrados (MIG) de Compute Engine o crea instancias de forma masiva. Luego, instala manualmente cualquier software clave que necesites en las instancias.

Elige un organizador

Un organizador automatiza la administración de tus clústeres. Con un organizador, no tienes que administrar cada instancia de procesamiento en el clúster. Un organizador, como Slurm o GKE, controla tareas como la puesta en cola de trabajos, la asignación de recursos, el ajuste de escala automático (en el caso de GKE) y otras tareas diarias de administración de clústeres.

  • Slurm: Slurm es un organizador de código abierto que se usa de uso frecuente para cargas de trabajo de HPC, IA, o AA. Para obtener una experiencia de Slurm administrada, puedes usar Cluster Director. Para usar Slurm de forma nativa, puedes usar Cluster Toolkit (que ofrece planos de clúster que instalan Slurm automáticamente en tus clústeres) o puedes instalar Slurm de forma manual en un clúster de Compute Engine.

  • GKE: GKE es un servicio administrado que se basa en Kubernetes, una plataforma de organización de contenedores de código abierto. GKE es ideal para implementar y administrar cargas de trabajo de IA o AA, debido a su capacidad para organizar aplicaciones alojadas en contenedores, su compatibilidad con hardware especializado y su lugar en el Google Cloud ecosistema. Puedes implementar clústeres de GKE directamente o con Cluster Toolkit.

  • Trae tu propio organizador: Para usar otros organizadores, usa clústeres de Compute Engine. Crear un clúster de Compute Engine es la opción menos administrada que se ofrece en Google Cloud. Esta opción significa que eres responsable de configurar, mantener y actualizar tus instancias.

Elige la imagen del sistema operativo

La imagen que debes usar depende de la infraestructura de GPU que uses (GPU en clúster o GPU generales) y de cómo planeas implementar tus clústeres (GKE, Slurm o Compute Engine). Para los clústeres de GKE, usa Container-Optimized OS. Para los clústeres de Compute Engine y Slurm, selecciona una imagen del sistema operativo optimizada para aceleradores, como las GPU. Además, puedes seleccionar una imagen de contenedor de la capa de software de aprendizaje profundo (DLSL) para tu carga de trabajo.

Para obtener información detallada, revisa las imágenes de AI Hypercomputer.

Imágenes para clústeres de GKE

Para crear clústeres de GKE, usa las imágenes predeterminadas del SO de contenedor para los modos Standard y Autopilot. Sin embargo, en el modo Standard, también puedes elegir usar otras imágenes disponibles, como Ubuntu.

Si usas Cluster Toolkit para implementar tu clúster, solo puedes usar imágenes del SO de contenedor, ya que son las imágenes integradas en los planos del clúster. Para obtener más información sobre cada imagen de nodo, consulta Imágenes denodo en la documentación de GKE.

GKE también ofrece imágenes de contenedor de la capa de software de aprendizaje profundo (DLSL) que instalan paquetes como NVIDIA CUDA y NCCL, así como frameworks de AA como PyTorch, lo que proporciona un entorno listo para usar para cargas de trabajo de aprendizaje profundo. Estas imágenes de contenedor de DLSL precompiladas se prueban y verifican para que funcionen sin problemas en los clústeres de GKE.

Imágenes de SO para clústeres de Compute Engine

AI Hypercomputer ofrece imágenes optimizadas para ejecutar cargas de trabajo de IA y AA con Compute Engine. Elige el SO con el que estés más familiarizado:

  • Acelerador con Rocky Linux 9
  • Acelerador con Rocky Linux 8
  • Acelerador con Ubuntu 24.04 LTS
  • Acelerador con Ubuntu 22.04 LTS

Si usas Cluster Toolkit, estas imágenes de aceleradores ya están agrupadas en los planos de Cluster Toolkit, ya que Cluster Toolkit crea imágenes personalizadas que extienden las imágenes de SO del acelerador con Ubuntu LTS.

Para obtener más información sobre cada imagen de SO, consulta Detalles del sistema operativo en la documentación de Compute Engine.

Crea tu clúster

Después de revisar el proceso de creación del clúster y tomar decisiones preliminares para tu carga de trabajo, crea tu clúster con una de estas opciones:

Aprovisiona almacenamiento para tu carga de trabajo

Elige un servicio de almacenamiento para aprovisionar, según los requisitos de rendimiento, costo y arquitectura de almacenamiento.