Gestisci pipeline
Questo documento descrive come gestire le pipeline BigQuery, inclusi i passaggi per visualizzare, pianificare, eseguire il deployment ed eliminare le pipeline.
Questo documento descrive anche come visualizzare e gestire i metadati delle pipeline in Knowledge Catalog.
Le pipeline sono basate su Dataform. Puoi organizzare e gestire le pipeline archiviate in File e cartelle (cartelle utente e cartelle del team) o nei repository Git di BigQuery Studio (cartelle Git) (anteprima).
Prima di iniziare
- Crea una pipeline BigQuery.
- Per gestire i metadati delle pipeline in Knowledge Catalog, assicurati che l'API Dataplex sia abilitata nel tuo Google Cloud progetto.
Ruoli obbligatori
Per ottenere le autorizzazioni necessarie per gestire le pipeline, chiedi all'amministratore di concederti i seguenti ruoli IAM:
-
Per visualizzare ed eseguire le pipeline:
- Dataform Viewer (
roles/dataform.Viewer) sul progetto - Utente job BigQuery (
roles/bigquery.jobUser) sul progetto
- Dataform Viewer (
-
Per eseguire le pipeline con le credenziali utente di un Account Google:
Editor dati BigQuery (
roles/bigquery.dataEditor) sul progetto o su set di dati BigQuery specifici -
Per eliminare le pipeline:
Dataform Admin (
roles/dataform.Admin) sulla pipeline -
Per gestire le pipeline nelle cartelle utente:
- Proprietario di codice (
roles/dataform.codeOwner) sulla cartella - Editor di codice (
roles/dataform.codeEditor) sulla cartella - Visualizzatore di codice (
roles/dataform.codeViewer) sulla cartella
- Proprietario di codice (
-
Per gestire le pipeline nelle cartelle del team:
- Team Folder Owner (
roles/dataform.teamFolderOwner) sulla cartella del team - Collaboratore cartella del team (
roles/dataform.teamFolderContributor) sulla cartella del team - Team Folder Viewer (
roles/dataform.teamFolderViewer) sulla cartella del team
- Team Folder Owner (
-
Per gestire le pipeline nei repository Git:
Utente OAuth Developer Connect (
roles/developerconnect.oauthUser) sul progetto -
Per visualizzare e gestire i metadati in Knowledge Catalog:
Dataplex Catalog Editor (
roles/dataplex.catalogEditor) sul progetto o sul gruppo di voci@bigquery
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Potresti anche riuscire a ottenere le autorizzazioni richieste tramite i ruoli personalizzati o altri ruoli predefiniti.
Per saperne di più su Dataform IAM, consulta Controllare l'accesso con IAM. Per saperne di più sui ruoli per le cartelle, consulta Creare e gestire le cartelle. Per saperne di più sui ruoli per i repository Git, consulta Gestire il codice con i repository Git di BigQuery Studio.
Se utilizzi un account di servizio personalizzato per eseguire le pipeline, devi concedere i seguenti ruoli a questo account di servizio:
- Utente job BigQuery
(
roles/bigquery.jobUser) sul progetto - Editor dati BigQuery
(
roles/bigquery.dataEditor) sul progetto o su set di dati BigQuery specifici - Editor del catalogo Dataplex
(
roles/dataplex.catalogEditor) sul progetto o sul gruppo di voci@bigquery
Visualizza le pipeline
Puoi visualizzare e ispezionare le pipeline archiviate nelle cartelle o nelle cartelle Git nel riquadro File. Puoi visualizzare le pipeline autonome e le pipeline archiviate nelle cartelle nel riquadro Explorer. Le pipeline archiviate nelle cartelle Git non vengono visualizzate nel riquadro Explorer.
Visualizza le pipeline nel riquadro File
Le pipeline archiviate nelle cartelle o nelle cartelle Git vengono visualizzate direttamente nel riquadro File.
Per visualizzare una pipeline archiviata in una cartella o in una cartella Git:
Nella Google Cloud console, vai alla BigQuery BigQuery.
Nel riquadro a sinistra, fai clic su File per aprire il browser dei file.
Se non vedi il riquadro a sinistra, fai clic su Espandi riquadro a sinistra per aprirlo.
Espandi la cartella Utente , una cartella del team o una cartella del repository Git connesso.
Le pipeline vengono visualizzate con un'icona Pipeline anziché con un'icona di cartella standard.
Fai clic su una cartella della pipeline per aprire il Visualizzatore pipeline.
Il Visualizzatore pipeline mostra il grafo diretto aciclico (DAG) compilato delle attività della pipeline, lo stato di esecuzione e le schede di configurazione.
Espandi la directory della pipeline nel browser dei file per sfogliare le directory nidificate (ad esempio
definitions/) e i singoli file delle attività.
Visualizza le pipeline nel riquadro Explorer
Per visualizzare un elenco di pipeline autonome e pipeline archiviate nelle cartelle:
Nella Google Cloud console, vai alla BigQuery BigQuery.
Nel riquadro a sinistra, fai clic su Explorer:

Se non vedi il riquadro a sinistra, fai clic su Espandi riquadro a sinistra per aprirlo.
Nel riquadro Explorer, espandi il progetto e fai clic su Pipeline.
Seleziona una pipeline per aprirla nel Visualizzatore pipeline.
Visualizza le esecuzioni manuali precedenti
Per visualizzare le esecuzioni manuali precedenti di una pipeline selezionata:
Nella Google Cloud console, vai alla BigQuery BigQuery.
Nel riquadro a sinistra, fai clic su Explorer:

Nel riquadro Explorer, espandi il progetto, fai clic su Pipeline, e poi seleziona una pipeline.
Fai clic su Esecuzioni.
(Facoltativo) Per aggiornare l'elenco delle esecuzioni precedenti, fai clic su Aggiorna.
Configura gli avvisi per le esecuzioni delle pipeline non riuscite
Ogni pipeline ha un ID repository Dataform corrispondente. Ogni esecuzione della pipeline BigQuery viene registrata in Cloud Logging utilizzando l'ID repository Dataform corrispondente. Puoi utilizzare Cloud Monitoring per osservare le tendenze nei log di Cloud Logging per le esecuzioni delle pipeline BigQuery e per ricevere una notifica quando si verificano le condizioni che hai descritto.
Per ricevere avvisi quando un'esecuzione della pipeline BigQuery non riesce, puoi creare una criterio di avviso basata sui log per l'ID repository Dataform corrispondente. Per le istruzioni, consulta Configurare gli avvisi per le chiamate ai workflow non riuscite.
Per trovare l'ID repository Dataform della pipeline:
Nella Google Cloud console, vai alla BigQuery BigQuery.
Nel riquadro a sinistra, fai clic su Explorer:

Nel riquadro Explorer, espandi il progetto, fai clic su Pipeline, e poi seleziona una pipeline.
Fai clic su Impostazioni.
L'ID repository Dataform della pipeline viene visualizzato nella parte inferiore della scheda Impostazioni.
Elimina una pipeline
Per eliminare definitivamente una pipeline:
- Nella Google Cloud console, vai alla BigQuery BigQuery. Vai a BigQuery
Per eliminare una pipeline archiviata in una cartella o in una cartella Git:
Nel riquadro a sinistra, fai clic su File.
Nell'albero dei file, individua la cartella della pipeline che vuoi eliminare.
Fai clic su Visualizza azioni accanto alla cartella della pipeline, quindi fai clic su Elimina.
Nella finestra di dialogo di conferma, fai clic su Elimina.
La cartella della pipeline e tutte le attività e i file in essa contenuti vengono eliminati dallo spazio di lavoro.
Per eliminare una pipeline elencata nel riquadro Explorer:
Nel riquadro a sinistra, fai clic su Explorer:

Nel riquadro Explorer, espandi il progetto e fai clic su Pipeline.
Trova la pipeline che vuoi eliminare.
Fai clic su Visualizza azioni accanto alla pipeline, quindi fai clic su Elimina.
Fai clic su Elimina.
Gestisci i metadati in Knowledge Catalog
Knowledge Catalog consente di archiviare e gestire i metadati delle pipeline. Le pipeline sono disponibili in Knowledge Catalog per impostazione predefinita, senza configurazione aggiuntiva.
Puoi utilizzare Knowledge Catalog per gestire le pipeline in tutte le posizioni delle pipeline. La gestione delle pipeline in Knowledge Catalog è soggetta a quote e limiti di Knowledge Catalog e prezzi di Knowledge Catalog.
Knowledge Catalog recupera automaticamente i seguenti metadati dalle pipeline:
- Nome dell'asset di dati
- Asset di dati padre
- Località dell'asset di dati
- Tipo di asset di dati
- Progetto corrispondente Google Cloud
Knowledge Catalog registra le pipeline come voci con i seguenti valori di voce:
- Gruppo di voci di sistema
- Il gruppo di voci di sistema
per le pipeline è
@dataform. Per visualizzare i dettagli delle voci della pipeline in Knowledge Catalog, devi visualizzare il gruppo di voci di sistemadataform. Per istruzioni su come visualizzare un elenco di tutte le voci in un gruppo di voci, consulta Visualizzare i dettagli di un gruppo di voci nella documentazione di Knowledge Catalog. - Tipo di voce di sistema
- Il tipo di voce di sistema
per le pipeline è
dataform-code-asset. Per visualizzare i dettagli delle pipeline,devi visualizzare il tipo di voce di sistemadataform-code-asset, filtrare i risultati con un filtro basato sugli aspetti, e impostare il campotypeall'interno dell'aspettodataform-code-assetsuWORKFLOW. Seleziona quindi una voce della pipeline selezionata. Per istruzioni su come visualizzare i dettagli di un tipo di voce selezionato, consulta Visualizzare i dettagli di un tipo di voce nella documentazione di Knowledge Catalog. Per istruzioni su come visualizzare i dettagli di una voce selezionata, consulta Visualizzare i dettagli di una voce nella documentazione di Knowledge Catalog. - Tipo di aspetto di sistema
- Il tipo di aspetto di sistema
per le pipeline è
dataform-code-asset. Per fornire un contesto aggiuntivo alle pipeline in Knowledge Catalog annotando le voci della pipeline di dati con gli aspetti, visualizza il tipo di aspettodataform-code-asset, filtra i risultati con un filtro basato sugli aspetti, e imposta il campotypeall'interno dell'aspettodataform-code-assetsuWORKFLOW. Per istruzioni su come annotare le voci con gli aspetti, consulta Gestire gli aspetti e arricchire i metadati nella documentazione di Knowledge Catalog. - Tipo
- Il tipo per le canvas di dati è
WORKFLOW. Questo tipo consente di filtrare le pipeline nel tipo di voce di sistemadataform-code-assete nel tipo di aspettodataform-code-assetutilizzando la queryaspect:dataplex-types.global.dataform-code-asset.type=WORKFLOWin un filtro basato sugli aspetti.
Per istruzioni su come cercare gli asset in Knowledge Catalog, consulta Cercare gli asset di dati in Knowledge Catalog nella documentazione di Knowledge Catalog.
Integrazione dell'arricchimento dei metadati e della scheda di valutazione della qualità dei dati
Dataform può pubblicare i seguenti metadati in Knowledge Catalog:
- Tipo di aspetto Panoramica
- Tipo di aspetto generico
- Tipo di aspetto della scheda di valutazione della qualità dei dati
Le asserzioni di Dataform vengono integrate automaticamente con la scheda di valutazione della qualità dei dati di Knowledge Catalog. Durante l'esecuzione della pipeline, i risultati di tutte le asserzioni di Dataform vengono pubblicati automaticamente in Knowledge Catalog. Questi risultati popolano la scheda di valutazione della qualità dei dati di Knowledge Catalog con uno stato di superamento o errore.
Per controllare lo stato di un aggiornamento dei metadati, segui le istruzioni riportate in Visualizzare le esecuzioni manuali precedenti.
Dopo aver sincronizzato i metadati, puoi cercare e visualizzare la voce in Knowledge Catalog. Per saperne di più, consulta Cercare le risorse.
Passaggi successivi
- Scopri di più sulle pipeline BigQuery.
- Scopri come creare le pipeline.
- Scopri come pianificare le pipeline.
- Scopri come gestire il codice con i repository Git di BigQuery Studio.
- Scopri come organizzare gli asset di codice con le cartelle.
- Scopri di più sui deployment di Dataform.