La traçabilité des données est une carte visuelle qui suit l'ensemble du cycle de vie de vos données. Elle vous indique d'où elles proviennent (l'origine), où elles circulent (les destinations), ainsi que toutes les modifications ou transformations qui se produisent en cours de route.
Vous pouvez consulter cette cartographie complète du parcours de vos données directement dans la consoleGoogle Cloud pour les composants créés dans des produits tels que Knowledge Catalog (anciennement Dataplex Universal Catalog), BigQuery (y compris les tables externes créées pour Iceberg REST Catalog) et Vertex AI. Étant donné que les workflows s'étendent souvent sur plusieurs régions, Knowledge Catalog est compatible avec la traçabilité multirégionale, qui offre une vue unifiée du parcours de vos données dans l'écosystème mondial Google Cloud . Les utilisateurs avancés peuvent également récupérer ces informations à l'aide de l' API Data Lineage.
Pourquoi avez-vous besoin de la traçabilité des données ?
Les entreprises modernes déplacent et modifient constamment de grandes quantités de données. Par exemple, en transformant les achats bruts des clients en rapports, tableaux de bord et modèles de machine learning. Cette complexité pose des problèmes critiques à votre équipe :
Confiance et validation. Les utilisateurs de données ont souvent du mal à confirmer que les rapports et les chiffres qu'ils voient sont exacts et proviennent d'une source fiable.
Dépannage. Lorsqu'une erreur apparaît dans un rapport final, les équipes de données peuvent avoir du mal à remonter à la source du problème à chaque étape, ce qui peut prendre du temps.
Gestion du changement Avant de modifier ou de supprimer une donnée (comme une colonne dans un tableau), les équipes doivent connaître chaque rapport ou modèle en aval qui en dépend pour éviter de casser des systèmes critiques.
Conformité. Les dirigeants doivent savoir comment les données sensibles (comme les informations financières ou sur les clients) sont utilisées dans l'ensemble de l'organisation pour répondre aux exigences réglementaires.
La traçabilité des données résout ces problèmes en fournissant un parcours clair, visuel et documenté de vos données. Cela vous permet de comprendre les sources de données, de suivre les erreurs, d'évaluer l'impact des modifications et de garantir la conformité.
Fonctionnement de la traçabilité des données
Le workflow de traçabilité des données comprend les étapes suivantes :
Sources de données et ingestion : les informations sur la traçabilité provenant de vos sources de données lancent l'ensemble du processus.
ServicesGoogle Cloud : lorsque l'API Data Lineage est activée, les services compatibles tels que BigQuery et Dataflow signalent automatiquement les événements de traçabilité chaque fois que des données sont déplacées ou transformées.
Sources personnalisées : pour tous les systèmes qui ne sont pas automatiquement compatibles avec les intégrationsGoogle Cloud , vous pouvez utiliser l'API Data Lineage pour enregistrer manuellement les informations de traçabilité. Nous vous recommandons d'importer des événements mis en forme selon la norme OpenLineage.
Plate-forme de traçabilité : cette plate-forme centrale ingère, modélise et stocke toutes les données de traçabilité.
API Data Lineage : cette API sert de point d'entrée unique pour toutes les informations de traçabilité entrantes. Elle utilise un modèle de données hiérarchique composé de trois concepts clés : processus, exécution et événement.
Traitement et stockage : la plate-forme traite les données entrantes et les stocke dans des bases de données fiables et optimisées pour les requêtes.
Expérience utilisateur : vous pouvez interagir avec les informations de traçabilité stockées de deux manières principales :
Exploration visuelle : dans la console Google Cloud , un service d'interface récupère et affiche les données de traçabilité sous forme de graphique ou de liste interactifs. Cette fonctionnalité est compatible avec Knowledge Catalog, BigQuery, Lakehouse (pour les tables Iceberg REST Catalog), la couche physique (Cloud Storage) et Vertex AI (pour les modèles, les ensembles de données, via les pipelines, les vues Feature Store et les groupes de caractéristiques). C'est idéal pour explorer visuellement le parcours de vos données.
Accès programmatique : à l'aide d'un client API, vous pouvez communiquer directement avec l'API Data Lineage pour automatiser la gestion de la traçabilité. Cela vous permet d'écrire des informations sur la traçabilité à partir de sources personnalisées. Il vous permet également de lire et d'interroger les données de traçabilité stockées pour les utiliser dans d'autres applications ou pour créer des rapports personnalisés.
Quelle méthode dois-je utiliser pour la traçabilité des données ?
Pour effectuer des recherches immédiates à un seul niveau, utilisez la méthode SearchLinks. Pour créer un graphique de traçabilité complet ou effectuer une analyse d'impact approfondie (jusqu'à 100 niveaux), utilisez la méthode SearchLineageStreaming.
Selon votre cas d'utilisation, sélectionnez la méthode la plus appropriée :
| Fonctionnalité | SearchLinks |
SearchLineageStreaming |
|---|---|---|
| Profondeur | 1 niveau (voisins immédiats) | Jusqu'à 100 niveaux |
| Exécution | Synchrone | Flux en temps réel |
| Cas d'utilisation | Recherches simples de sources ou de cibles directes | Créer un graphique de traçage complet ou effectuer une analyse de l'impact |
Identifier une direction
- Upstream (origines) :
- Dans
SearchLinks, définissez le champtargetsur le nom complet de votre élément. - Dans
SearchLineageStreaming, définissezdirectionsurUPSTREAM.
- Dans
- En aval (destinations) :
- Dans
SearchLinks, définissez le champsourcesur le nom complet de votre élément. - Dans
SearchLineageStreaming, définissezdirectionsurDOWNSTREAM.
- Dans
Modèle d'informations sur la traçabilité des données
La traçabilité est un enregistrement des données transformées de sources en cibles. L'API Data Lineage collecte ces informations et les organise dans un modèle de données hiérarchique à l'aide des concepts de processus, d'exécutions et d'événements.
| Concept | Description |
|---|---|
| Processus | Définition de la transformation des données. |
| Exécuter | Exécution d'un processus. |
| Événement | Enregistrement du déplacement des données lors d'une exécution. |
Qu'est-ce qu'un processus de traçabilité ?
Un processus est la définition d'une opération de transformation de données pour un système spécifique. Pour la traçabilité BigQuery, un processus est un job d'un type de job accepté. Toutes les exécutions d'une même requête SQL sont associées à un seul processus, ce qui vous permet de suivre chaque instance où une logique de transformation spécifique est utilisée.
Par exemple, la requête SQL suivante est un processus. Cette requête crée une table en comptant le nombre total de trajets pour chaque fournisseur à partir de deux tables sources.
CREATE TABLE `dataplex-docs.data_lineage_demo.total_green_trips_22_21`
AS
SELECT
vendor_id,
COUNT(*) AS number_of_trips
FROM
(
SELECT vendor_id
FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2022`
UNION ALL
SELECT vendor_id
FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2021`
)
GROUP BY
vendor_id;
Le format du nom de ressource REST pour un processus est projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID.
Par exemple : projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6
Pour en savoir plus sur la ressource process, consultez la documentation de référence sur la ressource Process.
Qu'est-ce qu'une exécution de la traçabilité ?
Une exécution correspond à une seule mise en œuvre d'un processus. Les processus peuvent comporter plusieurs exécutions.
Chaque exécution est une opération unique caractérisée par un startTime, un endTime et un état final, tel que COMPLETED, FAILED ou ABORTED.
Par exemple, l'exécution de la requête SQL de la section Processus à 9h crée une exécution spécifique. Si vous exécutez à nouveau la même requête à 10h, une nouvelle exécution distincte est créée. Les deux exécutions sont associées au même processus parent.
Le format du nom de ressource REST pour une exécution indique qu'il s'agit d'un enfant d'un processus :
projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID/runs/RUN_ID.
Par exemple : projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6/runs/83dd03a51cd2ac80f465c9e267a950b1
Pour en savoir plus sur la ressource run, consultez la documentation de référence sur la ressource Exécution.
Qu'est-ce qu'un événement de lignée ?
Un événement représente un point dans le temps où une transformation de données déplace des données entre une entité source et une entité cible. Un événement est un enregistrement précis d'un transfert de données spécifique qui relie les tables sources et cibles pour une exécution spécifique. Un événement peut également avoir plusieurs sources et cibles.
Par exemple, si votre exécution lance la requête SQL décrite dans la section Processus, un événement de traçabilité enregistre que les tables sources nyc_green_trips_2021 et nyc_green_trips_2022 sont utilisées pour créer la table cible total_green_trips_22_21.
Un événement de traçabilité contient une liste de liens qui définissent la source et la cible. Les événements sont utilisés pour créer des graphiques de traçabilité. Bien que la console Google Cloud présente ces graphiques de traçabilité, elle n'affiche pas directement les événements individuels. Vous pouvez créer, lire et supprimer des événements, mais pas les mettre à jour, à l'aide de l'API Data Lineage.
Chaque lien d'un événement définit un chemin unique de flux de données d'une entité source vers une entité cible. Une entité est une référence à un élément de données, tel qu'une table BigQuery, et est identifiée par son nom complet (FQN). Un même événement peut contenir plusieurs liens, ce qui est courant dans les opérations telles que les jointures de tables où plusieurs sources contribuent à une seule cible.
Pour savoir comment les événements sont compatibles avec la traçabilité au niveau des colonnes, consultez Traçabilité au niveau des colonnes.
Quelles sources de données sont compatibles avec la traçabilité des données ?
Vous pouvez renseigner des informations sur la traçabilité dans Knowledge Catalog de plusieurs manières :
- Automatiquement à partir des services Google Cloud intégrés
- Manuellement, en utilisant l'API Data Lineage pour les sources personnalisées
- En important des événements depuis OpenLineage
BigQuery
Lorsque vous activez la traçabilité des données dans votre projet BigQuery, Knowledge Catalog enregistre automatiquement les informations de traçabilité pour les éléments suivants :
Nouvelles tables résultant des jobs BigQuery suivants :
- Jobs de copie
- Jobs de chargement qui utilisent un URI Cloud Storage
- Jobs de requête qui utilisent le langage de définition de données (LDD) suivant dans GoogleSQL :
Tables existantes lorsque vous utilisez les instructions de langage de manipulation de données (LMD) suivantes dans GoogleSQL :
SELECTpar rapport à l'un des types de tables listés :INSERT SELECTMERGEUPDATEDELETE
Les jobs de copie, de requête et de chargement BigQuery sont représentés sous forme de processus.
Pour afficher les détails d'un processus, cliquez sur l'icône Détails du processus
dans le graphique de traçabilité.
Chaque processus contient le job_id BigQuery dans la liste attributes pour le job BigQuery le plus récent.
Autres services
La traçabilité des données est compatible avec les servicesGoogle Cloud suivants :
-
Vous ne pouvez pas limiter le suivi de la traçabilité à Cloud Data Fusion uniquement lorsque l'API Data Lineage est activée dans un projet.
-
Vous pouvez capturer des événements de traçabilité avec des jobs Dataflow et les publier dans l'API Data Lineage.
Lakehouse pour les tables du catalogue REST Iceberg
Looker (Google Cloud Core) (Aperçu)
La visualisation des métadonnées Looker (Google Cloud Core) à partir de sources BigQuery à l'aide de la traçabilité des données est possible. La traçabilité des données doit être activée au niveau de la ressource Looker (Google Cloud Core) et au niveau du service de traçabilité des données.
Managed Service pour Apache Airflow
Managed Airflow utilise un contrôle d'intégration de la traçabilité des données au niveau de l'environnement. Le lineage des données est automatiquement activé pour tous les nouveaux environnements Managed Airflow qui répondent aux exigences. Pour les environnements existants, utilisez les paramètres d'environnement pour activer ou désactiver l'intégration du lineage des données. Vous pouvez configurer l'ingestion de la traçabilité des données pour Managed Airflow afin d'activer ou de désactiver l'ingestion automatique de la traçabilité des données.
Managed Service pour Apache Spark : clusters Apache Hive
Vous pouvez capturer des événements de traçabilité avec les jobs Hive Managed Service pour Apache Spark et les publier dans l'API Data Lineage. Vous pouvez configurer l'ingestion de la traçabilité des données pour Managed Service pour Apache Spark afin d'activer ou de désactiver l'ingestion automatique de la traçabilité des données.
Managed Service pour Apache Spark : clusters Apache Spark
Vous pouvez capturer des événements de lignée avec des jobs Spark Managed Service pour Apache Spark et les publier dans l'API Data Lineage. Vous pouvez configurer l'ingestion de la traçabilité des données pour Managed Service pour Apache Spark afin d'activer ou de désactiver l'ingestion automatique de la traçabilité des données.
Managed Service pour Apache Spark : déploiement sans serveur
Vous pouvez capturer des événements de traçabilité avec les jobs sans serveur Managed Service pour Apache Spark et les publier dans l'API Data Lineage. Vous pouvez configurer l'ingestion de la traçabilité des données pour Managed Service pour Apache Spark afin d'activer ou de désactiver l'ingestion automatique de la traçabilité des données.
-
La traçabilité des données suit les métadonnées des vues Feature Store et des groupes de caractéristiques.
-
La traçabilité des données est automatiquement activée pour les pipelines Vertex AI Pipelines. Elle permet de suivre les artefacts d'entrée et les paramètres d'exécution (tels que les modèles, les ensembles de données et les composants), ainsi que les ressources dérivées en aval.
Traçabilité des données pour les sources de données personnalisées
Vous pouvez utiliser l'API Data Lineage pour enregistrer manuellement les informations de traçabilité pour toute source de données non compatible avec les systèmes intégrés, comme les bases de données externes ou les pipelines sur site. Knowledge Catalog peut créer des graphiques de traçabilité pour les données de traçabilité enregistrées manuellement si vous utilisez un fullyQualifiedName qui correspond aux noms complets des entrées Knowledge Catalog existantes. Si vous souhaitez enregistrer la traçabilité d'une source de données personnalisée, vous devez d'abord créer une entrée personnalisée.
Chaque processus pour une source de données personnalisée peut contenir une clé sql dans la liste des attributs. La valeur de cette clé est utilisée pour mettre en surbrillance le code dans le panneau des détails du graphique de traçabilité des données. L'instruction SQL s'affiche telle qu'elle a été fournie. Il vous incombe de filtrer les informations sensibles.
Le nom de la clé sql est sensible à la casse.
Par exemple, une charge utile de ressource de processus avec un attribut sql personnalisé :
{
"displayName": "custom-sql-query",
"attributes": {
"sql": "SELECT user_id, SUM(amount) FROM `project.dataset.purchases` GROUP BY user_id"
}
}
Pour en savoir plus, consultez Suivre les informations de traçabilité des systèmes externes.
OpenLineage
Si vous utilisez déjà OpenLineage pour collecter des informations de traçabilité à partir d'autres sources de données, vous pouvez importer des événements OpenLineage dans Knowledge Catalog et les afficher dans la console Google Cloud . Pour en savoir plus, consultez Intégrer à OpenLineage.
Suivi automatisé de la traçabilité des données
Lorsque vous activez l'API Data Lineage,les systèmes Google Cloud qui prennent en charge la traçabilité des données commencent à signaler leurs mouvements de données. Chaque système intégré peut envoyer des informations de traçabilité pour une plage différente de sources de données.
Contrôler l'ingestion de la traçabilité
Contrôler la génération de données sur la lignée vous aide à gérer les coûts et les règles de gouvernance. Par exemple, vous pouvez désactiver la collecte de la traçabilité pour les projets de développement ou les charges de travail à fort volume qui ne nécessitent pas de suivi de la traçabilité.
Pour savoir comment configurer et contrôler l'ingestion de la traçabilité, consultez Contrôler l'ingestion de la traçabilité pour un service.
Traçabilité des données multirégionale
La traçabilité des données est un service régionalisé par nature. Les métadonnées de traçabilité, y compris les liens, les processus et les événements, sont enregistrées et isolées de manière sécurisée dans la zone géographique spécifique où se produit la transformation des données sous-jacentes ou la modification des composants.
À mesure que les architectures de données d'entreprise modernes évoluent, les workflows de pipeline franchissent souvent les limites des projets et des régions. Par exemple, un pipeline de transformation BigQuery exécuté dans us-central1 peut lire une table source dans us-east1 et générer des métriques agrégées dans un bucket Cloud Storage situé dans europe-west1.
Pour obtenir une vue complète et de bout en bout du cycle de vie de vos données dans ces espaces géographiques indépendants, utilisez une méthode de recherche de traçabilité multirégionale.
Pour en savoir plus, consultez À propos de la recherche de traçabilité multirégionale.
Remarques et limites concernant la traçabilité des données
Lorsque vous planifiez votre stratégie de gouvernance des données, tenez compte des intégrations de traçabilité, des paramètres de conformité et des limites de service suivants.
Contrôles de la traçabilité au niveau du produit
Lorsque l'API Data Lineage est activée, les systèmes compatibles signalent la traçabilité en fonction de leurs contrôles au niveau du produit. Pour obtenir la liste complète des systèmes compatibles et de leurs contrôles, consultez Systèmes compatibles avec la traçabilité des données.
Conformité de la traçabilité des données
- La traçabilité des données enregistre les métadonnées sur le déplacement des données, mais ne capture pas les données elles-mêmes. Pour en savoir plus sur les champs inclus dans les métadonnées, consultez le modèle d'informations sur la traçabilité des données et la documentation de référence de l'API Data Lineage.
- La traçabilité des données dans Knowledge Catalog est compatible avec VPC-SC.
- Knowledge Catalog ne permet pas d'utiliser des clés de chiffrement gérées par le client (CMEK) pour protéger les métadonnées de traçabilité collectées.
Limites de la traçabilité des données
La traçabilité des données présente les limites suivantes :
Toutes les informations de traçabilité ne sont conservées dans le système que pendant 30 jours.
Les informations de traçabilité sont conservées même après la suppression de la source de données associée. Par exemple, si vous supprimez une table BigQuery, vous pouvez toujours afficher sa traçabilité dans l'API et la console pendant 30 jours maximum.
La traçabilité des données n'enregistre pas automatiquement les informations de traçabilité directe pour les routines BigQuery. Si une routine est utilisée dans une requête, la traçabilité des données enregistre la traçabilité entre les tables que la routine lit en tant que dépendances des tables que la requête écrit.
Lorsque vous sélectionnez un nœud dans le graphique de traçabilité, le panneau latéral des détails du nœud est vide dans les cas suivants :
- La ressource se trouve dans une autre organisation.
- L'utilisateur n'est pas membre de l'organisation qui héberge la ressource.
Limites de la traçabilité au niveau de la colonne
La traçabilité au niveau des colonnes présente les limites supplémentaires suivantes :
La traçabilité au niveau des colonnes n'est pas collectée pour les jobs de chargement BigQuery ni pour les routines.
La traçabilité en amont au niveau des colonnes n'est pas collectée pour les tables externes.
La traçabilité au niveau des colonnes n'est pas collectée si un job crée plus de 1 500 liens au niveau des colonnes. Dans ce cas, seule la lignée au niveau de la table est collectée.
La traçabilité au niveau des colonnes n'est disponible que pour les colonnes de premier niveau dans les tables BigQuery. Les champs imbriqués dans des types complexes (tels que STRUCT ou JSON) ne sont pas acceptés.
La fonctionnalité de recherche avec le paramètre de champ ne fonctionne que sur les liens qui définissent explicitement des relations de colonne à colonne. Il ne renvoie pas de résultats ni ne parcourt les liens qui ne sont définis qu'au niveau de la table. La recherche entre les liens au niveau des tables et les liens au niveau des colonnes n'est pas prise en charge (par exemple, trouver toutes les colonnes associées à un lien au niveau des tables ou inversement). L'API ne renvoie que les liens où la source et la cible spécifient un champ.
La compatibilité avec les tables partitionnées est limitée, car les colonnes de partitionnement telles que
_PARTITIONDATEet_PARTITIONTIMEne sont pas reconnues dans le graphique de traçabilité.Limites de la console :
- Le balayage de graphique de traçabilité est limité à une profondeur de 20 niveaux et à 10 000 liens dans chaque direction.
Tarifs
Knowledge Catalog utilise le SKU de traitement premium (mesuré en unités de calcul de données, ou DCU) pour facturer la traçabilité des données. Pour en savoir plus sur les tarifs, consultez Tarifs de Knowledge Catalog ou utilisez le simulateur de coûtGoogle Cloud .
Facteurs de coût et impact sur la facturation
Lorsque vous planifiez l'implémentation du lineage de données, gardez à l'esprit les facteurs de coût suivants :
- Activation par projet : L'API Data Lineage s'exécute par projet. Examinez l'impact sur la facturation avant d'activer cette fonctionnalité dans les workflows de projets comportant de nombreuses données.
- Stockage et recherche de métadonnées Les métadonnées de traçabilité (processus, exécutions, événements et liens) stockées pendant la période de conservation de 30 jours sont facturées selon le SKU de stockage des métadonnées. L'affichage de l'arborescence dans la console Google Cloud n'entraîne pas de frais de requête ni d'analyse BigQuery.
- BigQuery Omni Le traitement de la traçabilité est distribué à des régions spécifiques, et les coûts dépendent des régions où le traitement est effectué.
- Ensembles de données multirégionaux BigQuery. Si vous utilisez des ensembles de données multirégionaux (par exemple, la zone multirégionale
US), BigQuery achemine dynamiquement les requêtes dans les zones physiques des centres de données. Le lineage des données s'exécute en même temps que l'exécution des requêtes à l'emplacement physique où le job a été exécuté (par exemple,us-east1). Cela génère des entrées de SKU de DCU de lineage régional sur votre facture Cloud Billing. - Types de sources d'origine personnalisée. Si vous appelez l'API Data Lineage
OriginsourceTypeavec une valeur autre queCUSTOM, cela entraîne des coûts supplémentaires.
Surveiller et contrôler les coûts
- Limitation des métriques Cloud Monitoring La consommation d'UC de l'analyse de la traçabilité des données s'exécute sur un calcul sans serveur et n'émet pas de métriques de séries temporelles en temps réel sous
dataplex.googleapis.com/*vers Cloud Monitoring. - Filtrer et attribuer les frais dans Cloud Billing Pour séparer et attribuer les frais de traçabilité des données des autres frais associés au SKU de traitement premium Knowledge Catalog, utilisez le libellé
goog-dataplex-workload-typeavec la valeurLINEAGEdans le rapport Cloud Billing ou dans l'exportation Cloud Billing vers BigQuery. Pour obtenir des exemples de requêtes détaillés, consultez Surveiller et attribuer les coûts des DCU du Knowledge Catalog avec l'exportation Cloud Billing. - Désactivez-la dans les projets de développement. Pour éviter des coûts de traitement inutiles, n'activez l'API Data Lineage que dans les projets où le suivi de la traçabilité est requis.
- Arrêter les frais L'API Data Lineage est facturée séparément de l'API Dataplex. La désactivation de l'API Dataplex n'entraîne pas la désactivation de l'API Data Lineage ni l'arrêt de sa facturation. Pour ne plus être facturé pour la traçabilité des données, vous devez désactiver la traçabilité des données en désactivant l'API Data Lineage.
Étapes suivantes
Découvrez comment suivre la traçabilité des données pour une copie de table BigQuery et des jobs de requête.
Découvrez comment utiliser la traçabilité des données avec les systèmes Google Cloud.
Renseignez-vous sur les vues de traçabilité dans la consoleGoogle Cloud .
Découvrez l'API Data Lineage.
Pour obtenir des informations administratives, consultez les considérations et limites concernant la traçabilité des données et la journalisation d'audit de la traçabilité des données.