Limitaciones
Metastores con Hive 4.2: La versión de imagen
3.0no admite BigQuery Metastore, BigLake Metastore ni Dataproc Metastore con Hive 4.2 (no se admiten las consultas directas de Hive con estos metastores).Delta Lake con Hive: Delta Lake
4.x, que se incluye en la versión3.0de la imagen de Managed Service for Apache Spark, no admite Hive (las consultas en tablas de Delta Lake 4.2 no se pueden ejecutar en Hive).Iceberg con Hive: La versión de imagen
3.0de Managed Service para Apache Spark incluye Hive 4.2, que admite Iceberg a través del catálogo de REST de Iceberg.Clústeres de GPU: Todas las versiones de imagen de
3.0, excepto3.0-ml-ubuntu, habilitancgroups V2. Dado que YARN no admite la detección de GPU cuandocgroups V2está habilitado, debes usar la imagen3.0-ml-ubuntucuando crees clústeres con GPU.
Notas:
La versión
3.0es una imagen ligera que contiene solo componentes principales, lo que reduce la exposición a vulnerabilidades y exposiciones comunes (CVE). Para cumplir con requisitos de seguridad más estrictos, usa la versión de imagen2.3o posterior cuando crees un clúster de Managed Service para Apache Spark.Si eliges instalar componentes opcionales cuando crees un clúster de Managed Service para Apache Spark con la imagen de
3.0, se descargarán y se instalarán durante la creación del clúster. Esto podría aumentar el tiempo de inicio del clúster. Para evitar esta demora, puedes crear una imagen personalizada con los componentes opcionales preinstalados. Esto se logra ejecutandogenerate_custom_image.pycon la marca--optional-components.Los siguientes componentes opcionales son compatibles con las imágenes de la versión 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook de Apache Zeppelin
- Apache ZooKeeper
- Delta Lake
- Docker
- Notebook de JupyterLab
- Trino
yarn.nodemanager.recovery.enabledy el registro de auditoría de HDFS están habilitados de forma predeterminada en las imágenes 3.0.Pixi se instala como parte de la instalación de Python y se usa para instalar paquetes de Python en lugar de Conda.
La calculadora de recursos predeterminada para YARN se cambió de DefaultResourceCalculator a DominantResourceCalculator, que usa el concepto de recurso dominante para determinar la asignación de recursos, como la asignación de memoria y CPU. Este cambio afecta al escalador automático, que se ajusta según el uso de recursos dominante del clúster.
A partir de la versión de imagen
3.0, cuando creas un clúster sin especificar un tipo de máquina para un nodo del clúster, Managed Service para Apache Spark especifica el nodo con una lista clasificada de tipos de máquinas de VM flexibles, como una lista clasificada de tipos de máquinas de las series N4, N2 y E2, con la lista optimizada para la disponibilidad de recursos.