En esta página, se describen problemas conocidos con los que puedes encontrarte cuando ejecutas tus VMs o clústeres optimizados para IA. Si tienes problemas con las VMs de Compute Engine, consulta Problemas conocidos de Compute Engine.
Problemas
En la siguiente sección, se enumeran los problemas conocidos y las soluciones alternativas para AI Hypercomputer.
Interrupciones de cargas de trabajo en VMs A4 debido a problemas de firmware para GPUs NVIDIA B200
NVIDIA identificó dos problemas de firmware para las GPUs B200, que usan las VMs A4. Estos problemas pueden causar interrupciones en las cargas de trabajo, como que el comando nvidia-smi no responda. Si notas interrupciones en las cargas de trabajo en las VMs A4, confirma que se cumpla una de las siguientes condiciones:
- El tiempo de actividad de la VM (
lastStartTimestamp) supera los 65 días. - Los registros muestran un
Xid 149mensaje de error que menciona0x02a.
Si se cumple una de estas condiciones, debes restablecer las GPUs conectadas a tus VMs A4. Para evitar interrupciones futuras en tu carga de trabajo debido a problemas de firmware, te recomendamos que restablezcas tus GPUs al menos una vez cada 60 días. Para obtener más información, consulta Restablece las GPUs.
Es posible que el servidor de metadatos muestre metadatos physicalHost de VM antiguos
Después de experimentar un
error de host o
usar la
API de report faulty host para
mover una instancia de procesamiento a un host nuevo, cuando
consultas el servidor de metadatos,
es posible que muestre los metadatos physicalHost del host anterior de la instancia de procesamiento.
Para solucionar este problema, realiza una de las siguientes acciones:
- Usa el
instances.getmétodo o elgcloud compute instances describecomando para recuperar la informaciónphysicalHostcorrecta. - Detén y, luego, inicia tu
instancia. Este proceso actualiza la información
physicalHosten el servidor de metadatos. - Espera 24 horas para que se actualice la información
physicalHostde la instancia afectada.