Limitações
Metastores com Hive 4.2:a versão da imagem
3.0não é compatível com o BigQuery Metastore, o BigLake Metastore ou o Dataproc Metastore com Hive 4.2. Consultas diretas do Hive usando esses metastores não são compatíveis.Delta Lake com Hive:o Delta Lake
4.x, incluído na versão de imagem3.0do Serviço Gerenciado para Apache Spark, não é compatível com o Hive. As consultas em tabelas do Delta Lake 4.2 não podem ser executadas no Hive.Iceberg com Hive:a versão da imagem do Serviço Gerenciado para Apache Spark
3.0inclui o Hive 4.2, que é compatível com o Iceberg pelo catálogo REST do Iceberg.Clusters de GPU:todas as versões de imagem
3.0, exceto3.0-ml-ubuntu, ativam ocgroups V2. Como o YARN não oferece suporte à descoberta de GPU quandocgroups V2está ativado, use a imagem3.0-ml-ubuntuao criar clusters com GPUs.
Observações:
A versão
3.0é uma imagem leve que contém apenas componentes principais, reduzindo a exposição a vulnerabilidades e exposições comuns (CVEs). Para requisitos de conformidade de segurança mais altos, use a versão da imagem2.3ou mais recente ao criar um cluster do Serviço Gerenciado para Apache Spark.Se você optar por instalar componentes opcionais ao criar um cluster do Serviço Gerenciado para Apache Spark com a imagem
3.0, eles serão baixados e instalados durante a criação do cluster. Isso pode aumentar o tempo de inicialização do cluster. Para evitar esse atraso, crie uma imagem personalizada com os componentes opcionais pré-instalados. Para isso, executegenerate_custom_image.pycom a flag--optional-components.Os seguintes componentes opcionais são compatíveis com imagens 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook do Apache Zeppelin
- Apache ZooKeeper
- Delta Lake
- Docker
- Notebook do JupyterLab
- Trino
O
yarn.nodemanager.recovery.enablede o registro de auditoria do HDFS são ativados por padrão nas imagens 3.0.O Pixi é instalado como parte da instalação do Python e é usado para instalar pacotes Python em vez do Conda.
A calculadora de recursos padrão do YARN foi alterada de DefaultResourceCalculator para DominantResourceCalculator, que usa o conceito de recurso dominante para determinar a alocação de recursos, como memória e CPU. Essa mudança afeta o escalonador automático, que faz o escalonamento com base no uso de recursos dominante do cluster.
A partir da versão de imagem
3.0, quando você cria um cluster sem especificar um tipo de máquina para um nó de cluster, o Serviço Gerenciado para Apache Spark especifica o nó com uma lista classificada de tipos de máquinas de VM flexíveis, como uma lista classificada de tipos de máquinas das séries N4, N2 e E2, otimizada para disponibilidade de recursos.