Versões de imagem de lançamento 3.0.x

Componente 3.0.2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/09/04
3.0.1-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/08/19
3.0.0-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/07/15
3.0.0-RC2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/05/03
3.0.0-RC1-debian12/
-ubuntu24/
-rocky9
2025/09/08
Apache Flink
componente opcional
2.2.0 2.2.0 2.2.0
Apache Hadoop
instalado
3.5.0 3.5.0 3.5.0 3.5.0 3.4.1
Apache Hive
instalado
4.2.0 4.2.0 4.2.0 4.2.0 4.1.0
Apache Hive WebHCat
componente opcional
4.2.0 4.2.0 4.2.0
Apache Iceberg
componente opcional
1.11.0 1.11.0 1.11.0
Apache Hudi
componente opcional
1.2.0
Apache Kafka
ação de inicialização
3.9.2 3.9.2 3.9.2
Apache Pig
componente opcional
0.18.0 0.18.0 0.18.0 0.18.0-SNAPSHOT
Apache Ranger
componente opcional
2.8.0 2.8.0
Apache Spark
instalado
4.1.2 4.1.2 4.1.2 4.1.1 4.0.0
Apache Solr
componente opcional
9.10.1 9.10.1 9.10.1 9.7.0
Apache Tez
instalado
0.10.5 0.10.5 0.10.5 0.10.5 0.10.5
Notebook do Apache Zeppelin
componente opcional
0.12.0 0.12.0 0.12.0
Apache Zookeeper
componente opcional
3.9.5 3.9.5 3.9.5 3.9.3
Conector do BigQuery
instalado
0.44.1-Preview 0.44.1-Preview 0.44.1-Preview 0.44.1-Preview
Cloud Storage Connector
instalado
4.0.4 3.1.13 3.1.13 3.1.13 3.1.6
Conscrypt
instalado
2.6 2.6 2.6 2.6
Delta Lake
componente opcional
4.2.0 4.2.0
Docker
componente opcional
28.1 28.1 28.1
Java
instalado
21 21 21 21 17
Notebook JupyterLab
componente opcional
4.5.7 4.5.7 4.5.7
Python
instalado
Pixi 0.76.0 com Python 3.12 Pixi 0.67.1 com Python 3.12 Pixi 0.67.1 com Python 3.12 Pixi 0.67.1 com Python 3.11 micromamba 2.0.5 com Python 3.11
R
instalado
R 4.5 R 4.5 R 4.5 R 4.5 R 4.3
Scala
instalado
2.13.17 2.13.17 2.13.17 2.13.17 2.13.14
Trino
componente opcional
480 480 480

Limitações

  • Metastores com Hive 4.2:a versão da imagem 3.0 não é compatível com o BigQuery Metastore, o BigLake Metastore ou o Dataproc Metastore com Hive 4.2. Consultas diretas do Hive usando esses metastores não são compatíveis.

  • Delta Lake com Hive:o Delta Lake 4.x, incluído na versão de imagem 3.0 do Serviço Gerenciado para Apache Spark, não é compatível com o Hive. As consultas em tabelas do Delta Lake 4.2 não podem ser executadas no Hive.

  • Iceberg com Hive:a versão da imagem do Serviço Gerenciado para Apache Spark 3.0 inclui o Hive 4.2, que é compatível com o Iceberg pelo catálogo REST do Iceberg.

  • Clusters de GPU:todas as versões de imagem 3.0, exceto 3.0-ml-ubuntu, ativam o cgroups V2. Como o YARN não oferece suporte à descoberta de GPU quando cgroups V2 está ativado, use a imagem 3.0-ml-ubuntu ao criar clusters com GPUs.

Observações:

  • A versão 3.0 é uma imagem leve que contém apenas componentes principais, reduzindo a exposição a vulnerabilidades e exposições comuns (CVEs). Para requisitos de conformidade de segurança mais altos, use a versão da imagem 2.3 ou mais recente ao criar um cluster do Serviço Gerenciado para Apache Spark.

  • Se você optar por instalar componentes opcionais ao criar um cluster do Serviço Gerenciado para Apache Spark com a imagem 3.0, eles serão baixados e instalados durante a criação do cluster. Isso pode aumentar o tempo de inicialização do cluster. Para evitar esse atraso, crie uma imagem personalizada com os componentes opcionais pré-instalados. Para isso, execute generate_custom_image.py com a flag --optional-components.

  • Os seguintes componentes opcionais são compatíveis com imagens 3.0:

    • Apache Flink
    • Apache Hive WebHCat
    • Apache Iceberg
    • Apache Pig
    • Apache Ranger
    • Apache Solr
    • Notebook do Apache Zeppelin
    • Apache ZooKeeper
    • Delta Lake
    • Docker
    • Notebook do JupyterLab
    • Trino
  • O yarn.nodemanager.recovery.enabled e o registro de auditoria do HDFS são ativados por padrão nas imagens 3.0.

  • O Pixi é instalado como parte da instalação do Python e é usado para instalar pacotes Python em vez do Conda.

  • A calculadora de recursos padrão do YARN foi alterada de DefaultResourceCalculator para DominantResourceCalculator, que usa o conceito de recurso dominante para determinar a alocação de recursos, como memória e CPU. Essa mudança afeta o escalonador automático, que faz o escalonamento com base no uso de recursos dominante do cluster.

  • A partir da versão de imagem 3.0, quando você cria um cluster sem especificar um tipo de máquina para um nó de cluster, o Serviço Gerenciado para Apache Spark especifica o nó com uma lista classificada de tipos de máquinas de VM flexíveis, como uma lista classificada de tipos de máquinas das séries N4, N2 e E2, otimizada para disponibilidade de recursos.