Limitazioni
Metastore con Hive 4.2: la versione dell'immagine
3.0non supporta BigQuery Metastore, BigLake Metastore o Dataproc Metastore con Hive 4.2 (le query Hive dirette che utilizzano questi metastore non sono supportate).Delta Lake con Hive:Delta Lake
4.x, incluso nella versione dell'immagine di Managed Service for Apache Spark3.0, non supporta Hive (le query sulle tabelle Delta Lake 4.2 non possono essere eseguite su Hive).Iceberg con Hive:la versione dell'immagine Managed Service for Apache Spark
3.0include Hive 4.2, che supporta Iceberg tramite il catalogo Iceberg REST.Cluster GPU:tutte le versioni dell'immagine
3.0, ad eccezione di3.0-ml-ubuntu, abilitanocgroups V2. Poiché YARN non supporta il rilevamento delle GPU quando è abilitatocgroups V2, devi utilizzare l'immagine3.0-ml-ubuntuquando crei cluster con GPU.
Note:
La versione
3.0è un'immagine leggera che contiene solo i componenti principali, riducendo l'esposizione a vulnerabilità ed esposizioni comuni (CVE). Per requisiti di conformità alla sicurezza più elevati, utilizza la versione dell'immagine2.3o successive quando crei un cluster Managed Service for Apache Spark.Se scegli di installare componenti facoltativi durante la creazione di un cluster Managed Service for Apache Spark con l'immagine
3.0, questi verranno scaricati e installati durante la creazione del cluster. Questa operazione potrebbe aumentare il tempo di avvio del cluster. Per evitare questo ritardo, puoi creare un'immagine personalizzata con i componenti facoltativi preinstallati. Ciò si ottiene eseguendogenerate_custom_image.pycon il flag--optional-components.I seguenti componenti facoltativi sono supportati nelle immagini 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook Apache Zeppelin
- Apache Zookeeper
- Delta Lake
- Docker
- Blocco note JupyterLab
- Trino
yarn.nodemanager.recovery.enablede l'audit logging di HDFS sono abilitati per impostazione predefinita nelle immagini 3.0.Pixi viene installato nell'ambito dell'installazione di Python e viene utilizzato per installare i pacchetti Python anziché Conda.
Il calcolatore delle risorse predefinito per YARN è stato modificato da DefaultResourceCalculator a DominantResourceCalculator, che utilizza il concetto di risorsa dominante per determinare l'allocazione delle risorse, come l'allocazione di memoria e CPU. Questa modifica influisce su Autoscaler, che esegue lo scale in base all'utilizzo delle risorse dominante del cluster.
A partire dalla versione immagine
3.0, quando crei un cluster senza specificare un tipo di macchina per un nodo del cluster, Managed Service for Apache Spark specifica il nodo con un elenco classificato di tipi di macchine VM flessibili, ad esempio un elenco classificato di tipi di macchine delle serie N4, N2 ed E2, con l'elenco ottimizzato per la disponibilità delle risorse.