Versiones de imágenes de la versión 3.0.x

Componente 3.0.2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/09/04
3.0.1-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/08/19
3.0.0-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/07/15
3.0.0-RC2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/05/03
3.0.0-RC1-debian12/
-ubuntu24/
-rocky9
2025/09/08
Apache Flink
componente opcional
2.2.0 2.2.0 2.2.0
Apache Hadoop
instalado
3.5.0 3.5.0 3.5.0 3.5.0 3.4.1
Apache Hive
instalado
4.2.0 4.2.0 4.2.0 4.2.0 4.1.0
Componente opcional de
Apache Hive WebHCat
4.2.0 4.2.0 4.2.0
Apache Iceberg
componente opcional
1.11.0 1.11.0 1.11.0
Apache Hudi
componente opcional
1.2.0
Acción de inicialización de
Apache Kafka
3.9.2 3.9.2 3.9.2
Apache Pig
componente opcional
0.18.0 0.18.0 0.18.0 0.18.0-SNAPSHOT
Apache Ranger
componente opcional
2.8.0 2.8.0
Apache Spark
instalado
4.1.2 4.1.2 4.1.2 4.1.1 4.0.0
Componente opcional de
Apache Solr
9.10.1 9.10.1 9.10.1 9.7.0
Apache Tez
instalado
0.10.5 0.10.5 0.10.5 0.10.5 0.10.5
Notebook de Apache Zeppelin
componente opcional
0.12.0 0.12.0 0.12.0
Componente opcional de
Apache Zookeeper
3.9.5 3.9.5 3.9.5 3.9.3
Conector de BigQuery
instalado
0.44.1-Preview 0.44.1-Preview 0.44.1-Preview 0.44.1-Preview
Conector de Cloud Storage
instalado
4.0.4 3.1.13 3.1.13 3.1.13 3.1.6
Conscrypt
instalado
2.6 2.6 2.6 2.6
Delta Lake
componente opcional
4.2.0 4.2.0
Docker
componente opcional
28.1 28.1 28.1
Java
instalado
21 21 21 21 17
Componente opcional de
Notebook de JupyterLab
4.5.7 4.5.7 4.5.7
Python
instalado
Pixi 0.76.0 con Python 3.12 Pixi 0.67.1 con Python 3.12 Pixi 0.67.1 con Python 3.12 Pixi 0.67.1 con Python 3.11 micromamba 2.0.5 con Python 3.11
R
instalado
R 4.5 R 4.5 R 4.5 R 4.5 R 4.3
Scala
instalado
2.13.17 2.13.17 2.13.17 2.13.17 2.13.14
Componente opcional de
Trino
480 480 480

Limitaciones

  • Metastores con Hive 4.2: La versión de imagen 3.0 no admite BigQuery Metastore, BigLake Metastore ni Dataproc Metastore con Hive 4.2 (no se admiten las consultas directas de Hive con estos metastores).

  • Delta Lake con Hive: Delta Lake 4.x, que se incluye en la versión 3.0 de la imagen de Managed Service for Apache Spark, no admite Hive (las consultas en tablas de Delta Lake 4.2 no se pueden ejecutar en Hive).

  • Iceberg con Hive: La versión de imagen 3.0 de Managed Service para Apache Spark incluye Hive 4.2, que admite Iceberg a través del catálogo de REST de Iceberg.

  • Clústeres de GPU: Todas las versiones de imagen de 3.0, excepto 3.0-ml-ubuntu, habilitan cgroups V2. Dado que YARN no admite la detección de GPU cuando cgroups V2 está habilitado, debes usar la imagen 3.0-ml-ubuntu cuando crees clústeres con GPU.

Notas:

  • La versión 3.0 es una imagen ligera que contiene solo componentes principales, lo que reduce la exposición a vulnerabilidades y exposiciones comunes (CVE). Para cumplir con requisitos de seguridad más estrictos, usa la versión de imagen 2.3o posterior cuando crees un clúster de Managed Service para Apache Spark.

  • Si eliges instalar componentes opcionales cuando crees un clúster de Managed Service para Apache Spark con la imagen de 3.0, se descargarán y se instalarán durante la creación del clúster. Esto podría aumentar el tiempo de inicio del clúster. Para evitar esta demora, puedes crear una imagen personalizada con los componentes opcionales preinstalados. Esto se logra ejecutando generate_custom_image.py con la marca --optional-components.

  • Los siguientes componentes opcionales son compatibles con las imágenes de la versión 3.0:

    • Apache Flink
    • Apache Hive WebHCat
    • Apache Iceberg
    • Apache Pig
    • Apache Ranger
    • Apache Solr
    • Notebook de Apache Zeppelin
    • Apache ZooKeeper
    • Delta Lake
    • Docker
    • Notebook de JupyterLab
    • Trino
  • yarn.nodemanager.recovery.enabled y el registro de auditoría de HDFS están habilitados de forma predeterminada en las imágenes 3.0.

  • Pixi se instala como parte de la instalación de Python y se usa para instalar paquetes de Python en lugar de Conda.

  • La calculadora de recursos predeterminada para YARN se cambió de DefaultResourceCalculator a DominantResourceCalculator, que usa el concepto de recurso dominante para determinar la asignación de recursos, como la asignación de memoria y CPU. Este cambio afecta al escalador automático, que se ajusta según el uso de recursos dominante del clúster.

  • A partir de la versión de imagen 3.0, cuando creas un clúster sin especificar un tipo de máquina para un nodo del clúster, Managed Service para Apache Spark especifica el nodo con una lista clasificada de tipos de máquinas de VM flexibles, como una lista clasificada de tipos de máquinas de las series N4, N2 y E2, con la lista optimizada para la disponibilidad de recursos.