Ce document explique comment utiliser les analyses de la qualité des données Knowledge Catalog (anciennement Dataplex Universal Catalog) pour mesurer, surveiller et gérer la qualité de vos données. Les analyses de la qualité des données vous aident à automatiser le processus de validation de vos données en termes d'exhaustivité, de validité et de cohérence.
Les analyses de la qualité des données vous permettent de définir des règles pour rechercher les valeurs manquantes, vous assurer que les valeurs correspondent à une expression régulière ou appartiennent à un ensemble, vérifier l'unicité ou utiliser un code SQL personnalisé pour des validations plus complexes, comme la détection des anomalies. Ce document explique comment créer et gérer des analyses de la qualité des données.
En savoir plus sur les analyses de la qualité des données Découvrez comment réutiliser des règles de qualité des données dans plusieurs analyses.
Avant de commencer
-
Activer l'API Dataplex
Rôles requis pour activer les API
Pour activer les API, vous devez disposer de l'autorisation
serviceusage.services.enable. Si vous avez créé le projet, vous disposez probablement déjà de cette autorisation grâce au rôle Propriétaire (roles/owner). Sinon, vous pouvez obtenir cette autorisation grâce au rôle Administrateur Service Usage (roles/serviceusage.serviceUsageAdmin). Découvrez comment attribuer des rôles. - Facultatif : Pour générer des recommandations pour les règles de qualité des données en fonction des résultats d'une analyse de profilage des données, créez et exécutez l'analyse de profilage des données.
Rôles et autorisations nécessaires
Cette section décrit les rôles et autorisations IAM nécessaires pour utiliser les analyses de la qualité des données Knowledge Catalog.
Rôles et autorisations des utilisateurs
Pour obtenir les autorisations nécessaires pour exécuter et gérer des analyses de la qualité des données, demandez à votre administrateur de vous accorder les rôles IAM suivants :
-
Exécuter une analyse de la qualité des données sur une table BigQuery :
- Utilisateur de job BigQuery (
roles/bigquery.jobUser) sur le projet pour exécuter des jobs d'analyse - Lecteur de données BigQuery (
roles/bigquery.dataViewer) sur la table BigQuery à analyser
- Utilisateur de job BigQuery (
-
Publiez les résultats de l'analyse de la qualité des données dans Knowledge Catalog :
- Éditeur de données BigQuery (
roles/bigquery.dataEditor) sur la table analysée - Éditeur de catalogue Dataplex (
roles/dataplex.catalogEditor) sur le groupe d'entrées@bigqueryau même emplacement que le tableau
- Éditeur de données BigQuery (
-
Effectuez des tâches spécifiques sur les ressources
DataScan:- Administrateur Dataplex DataScan (
roles/dataplex.dataScanAdmin) sur le projet pour un accès complet - Créateur Dataplex DataScan (
roles/dataplex.dataScanCreator) sur le projet pour créer des analyses - Éditeur Dataplex DataScan (
roles/dataplex.dataScanEditor) sur le projet pour l'accès en écriture - Lecteur Dataplex DataScan (
roles/dataplex.dataScanViewer) sur le projet pour lire les métadonnées d'analyse - Lecteur de données Dataplex DataScan (
roles/dataplex.dataScanDataViewer) sur le projet pour lire les données d'analyse, y compris les règles et les résultats
- Administrateur Dataplex DataScan (
Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.
Ces rôles prédéfinis contiennent les autorisations requises pour exécuter et gérer les analyses de la qualité des données. Pour connaître les autorisations exactes requises, développez la section Autorisations requises :
Autorisations requises
Les autorisations suivantes sont requises pour exécuter et gérer les analyses de la qualité des données :
-
Exécuter une analyse de la qualité des données sur une table BigQuery :
-
bigquery.jobs.createsur le projet pour exécuter des tâches d'analyse -
bigquery.tables.getsur la table BigQuery à analyser -
bigquery.tables.getDatasur la table BigQuery à analyser
-
-
Publiez les résultats de l'analyse de la qualité des données dans Knowledge Catalog :
-
bigquery.tables.updatesur la table analysée -
dataplex.entryGroups.useDataQualityScorecardAspectsur le groupe d'entrées@bigqueryau même emplacement que le tableau
-
-
Créez un
DataScan:dataplex.datascans.createsur le projet -
Supprimer un
DataScan:dataplex.datascans.deletesur le projet -
Afficher les métadonnées
DataScan:dataplex.datascans.getsur le projet -
Affichez les détails de
DataScan, y compris les règles et les résultats :dataplex.datascans.getDatasur le projet -
Lister les
DataScan:dataplex.datascans.listsur le projet -
Exécuter un
DataScan:dataplex.datascans.runsur le projet -
Mettre à jour un
DataScan:dataplex.datascans.updatesur le projet -
Obtenir ou définir une stratégie IAM sur un
DataScan:dataplex.datascans.getIamPolicysur le projetdataplex.datascans.setIamPolicysur le projet
Vous pouvez également obtenir ces autorisations avec des rôles personnalisés ou d'autres rôles prédéfinis.
Si vous devez accéder à des colonnes protégées par des règles d'accès BigQuery au niveau des colonnes, vous devez également disposer des autorisations correspondantes.
Rôles et autorisations des comptes de service Knowledge Catalog
Si vous n'avez créé aucune analyse de la qualité des données ni aucune analyse de profilage des données, ou si vous ne disposez d'aucun lac Knowledge Catalog dans ce projet, créez un identifiant de service en exécutant la commande suivante : gcloud beta services identity create --service=dataplex.googleapis.com.
Cette commande renvoie un identifiant de service Knowledge Catalog s'il existe.
Pour vous assurer que le compte de service Knowledge Catalog du projet contenant l'analyse de la qualité des données dispose des autorisations nécessaires pour lire les données provenant de différentes sources et exporter les résultats, demandez à votre administrateur d'accorder les rôles IAM suivants au compte de service Knowledge Catalog du projet contenant l'analyse de la qualité des données :
-
Lire les données des table BigQuery :
Lecteur de données BigQuery (
roles/bigquery.dataViewer) sur les tables à analyser et toutes les autres tables référencées dans les règles -
Lire les données des tables Lakehouse Iceberg REST Catalog, SAP Business Data Cloud Delta Lake et Apache Hive sur Google Cloud :
Lecteur BigLake (
roles/biglake.viewer) sur les tables respectives à analyser et sur toutes les autres tables référencées dans les règles -
Exporter les résultats d'analyse vers une table BigQuery :
Éditeur de données BigQuery (
roles/bigquery.dataEditor) sur l'ensemble de données et la table de résultats -
Analysez les données BigQuery organisées dans un lac Knowledge Catalog :
- Lecteur de métadonnées Dataplex (
roles/dataplex.metadataReader) sur les ressources Dataplex - Lecteur Dataplex (
roles/dataplex.viewer) sur les ressources Dataplex
- Lecteur de métadonnées Dataplex (
-
Analyser une table externe BigQuery à partir de Cloud Storage :
Lecteur des objets Storage (
roles/storage.objectViewer) sur le bucket Cloud Storage
Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.
Ces rôles prédéfinis contiennent les autorisations requises pour lire les données de différentes sources et exporter les résultats. Pour connaître les autorisations exactes requises, développez la section Autorisations requises :
Autorisations requises
Vous devez disposer des autorisations suivantes pour lire les données de différentes sources et exporter les résultats :
-
Lire les données d'une table BigQuery :
-
bigquery.tables.getsur les tables BigQuery -
bigquery.tables.getDatasur les tables BigQuery
-
-
Exportez les résultats de l'analyse vers une table BigQuery :
-
bigquery.datasets.getsur l'ensemble de données et la table de résultats -
bigquery.tables.createsur l'ensemble de données et la table de résultats -
bigquery.tables.getsur l'ensemble de données et la table de résultats -
bigquery.tables.getDatasur l'ensemble de données et la table de résultats -
bigquery.tables.updatesur l'ensemble de données et la table de résultats -
bigquery.tables.updateDatasur l'ensemble de données et la table de résultats
-
-
Analysez les données BigQuery organisées dans un lac Knowledge Catalog :
-
dataplex.lakes.listsur les ressources Dataplex -
dataplex.lakes.getsur les ressources Dataplex -
dataplex.zones.listsur les ressources Dataplex -
dataplex.zones.getsur les ressources Dataplex -
dataplex.entities.listsur les ressources Dataplex -
dataplex.entities.getsur les ressources Dataplex -
dataplex.operations.getsur les ressources Dataplex
-
-
Analyser une table externe BigQuery à partir de Cloud Storage :
-
storage.buckets.getsur le bucket Cloud Storage -
storage.objects.getsur le bucket Cloud Storage
-
Votre administrateur peut également attribuer au compte de service du Knowledge Catalog du projet contenant l'analyse de la qualité des données ces autorisations avec des rôles personnalisés ou d'autres rôles prédéfinis.
Si vous devez accéder à des colonnes protégées par des règles d'accès BigQuery au niveau des colonnes, attribuez les autorisations correspondantes au compte de service Knowledge Catalog.
Si des règles d'accès BigQuery au niveau des lignes sont activées pour une table, vous ne pouvez analyser que les lignes visibles par le compte de service Knowledge Catalog. Notez que les droits d'accès de chaque utilisateur ne sont pas évalués pour les règles au niveau des lignes.
Exigences de mise en réseau
Pour exécuter une analyse, vous devez activer l'accès privé à Google sur le sous-réseau VPC que vous utilisez pour l'analyse. Si vous ne spécifiez pas de sous-réseau, assurez-vous que l'accès privé à Google est activé sur votre sous-réseau par défaut.
Définir des règles de qualité des données
Vous pouvez définir des règles de qualité des données à l'aide des éléments suivants :
Règles réutilisables, y compris les modèles de règles système
Si vous utilisez la Google Cloud CLI, vous pouvez définir ces règles dans un fichier JSON ou YAML.
Les exemples des sections suivantes montrent comment définir différentes règles de qualité des données. Les règles valident un exemple de table contenant des données sur les transactions des clients. La table présente le schéma suivant :
| Nom de la colonne | Type de colonne | Description de la colonne |
|---|---|---|
| transaction_timestamp | Code temporel | Code temporel de la transaction. La table est partitionnée en fonction de ce champ. |
| customer_id | Chaîne | Un numéro client contenant huit lettres suivies de 16 chiffres. |
| transaction_id | Chaîne | L'ID de transaction doit être unique dans la table. |
| currency_id | Chaîne | L'une des devises acceptées. Le type de devise doit correspondre à l'une des devises disponibles dans la table de dimensions dim_currency.
|
| amount | Nombre à virgule flottante | Montant de la transaction. |
| discount_pct | Nombre à virgule flottante | Pourcentage de remise. Cette valeur doit être comprise entre 0 et 100. |
Définir des règles de qualité des données à l'aide de types de règles intégrés
Les exemples suivants sont basés sur des types de règles intégrés. Vous pouvez créer des règles basées sur des types de règles intégrés à l'aide de la console Google Cloud ou de l'API. Knowledge Catalog peut recommander certaines de ces règles.
| Nom de la colonne | Type de règle | Dimension suggérée | Paramètres de la règle |
|---|---|---|---|
transaction_id |
Vérification de l'originalité | Unicité | Seuil : Not Applicable |
amount |
Contrôle des valeurs nulles | Exhaustivité | Seuil : 100% |
customer_id |
Contrôle des expressions régulières | Validité | Expression régulière : ^[a-zA-Z]{8}[0-9]{16}$ Seuil : 100%
|
currency_id |
Vérification de la valeur définie | Validité | Ensemble : USD,JPY,INR,GBP,CAN Seuil : 100%
|
Définir des règles de qualité des données à l'aide de règles SQL personnalisées
Pour créer des règles SQL personnalisées, utilisez le framework suivant :
Lorsque vous créez une règle qui évalue une ligne à la fois, créez une expression qui génère le nombre de lignes réussies lorsque Knowledge Catalog évalue la requête
SELECT COUNTIF(CUSTOM_SQL_EXPRESSION) FROM TABLE. Knowledge Catalog compare le nombre de lignes réussies au seuil.Lorsque vous créez une règle qui évalue les lignes ou utilise une condition de table, créez une expression qui renvoie un résultat de succès ou d'échec lorsque Knowledge Catalog évalue la requête
SELECT IF(CUSTOM_SQL_EXPRESSION) FROM TABLE.Lorsque vous créez une règle qui évalue l'état non valide d'un ensemble de données, fournissez une instruction qui renvoie les lignes non valides. Si des lignes sont renvoyées, la règle échoue. Omettez le point-virgule de fin de l'instruction SQL.
Vous pouvez faire référence à une table de source de données et à tous ses filtres de préconditions en utilisant le paramètre de référence de données
${data()}dans une règle, au lieu de mentionner explicitement la table source et ses filtres. Les filtres de préconditions incluent, par exemple, les filtres de lignes, les pourcentages d'échantillonnage et les filtres incrémentaux. Le paramètre${data()}est sensible à la casse.
Les exemples suivants sont basés sur des règles SQL personnalisées.
| Type de règle | Description de la règle | Expression SQL |
|---|---|---|
| Condition de ligne | Vérifie si la valeur de discount_pct est comprise entre 0 et 100.
|
0 < discount_pct AND discount_pct < 100
|
| Condition de ligne | Vérifie que currency_id fait partie des devises acceptées.
|
currency_id in (select id from my_project_id.dim_dataset.dim_currency)
|
| Condition de table | Expression SQL agrégée qui vérifie si la moyenne discount_pct est comprise entre 30 et 50 %.
|
30<avg(discount) AND avg(discount) <50
|
| Condition de ligne | Vérifie si une date n'est pas dans le futur. | TIMESTAMP(transaction_timestamp) < CURRENT_TIMESTAMP()
|
| Condition de table |
Fonction définie par l'utilisateur BigQuery (UDF, user-defined function) pour vérifier que le montant moyen des transactions est inférieur à une valeur prédéfinie par pays. Créez la UDF (JavaScript) en exécutant la commande suivante :
CREATE OR REPLACE FUNCTION
myProject.myDataset.average_by_country (
country STRING, average FLOAT64)
RETURNS BOOL LANGUAGE js AS R"""
if (country = "CAN" && average < 5000){
return 1
} else if (country = "IND" && average < 1000){
return 1
} else { return 0 }
""";
|
Exemple de règle permettant de vérifier le montant moyen des transactions pour country=CAN.
myProject.myDataset.average_by_country(
"CAN",
(SELECT avg(amount) FROM
myProject.myDataset.transactions_table
WHERE currency_id = 'CAN'
))
|
| Condition de table | Clause de prédiction BigQuery ML permettant d'identifier les anomalies dans discount_pct. Elle vérifie si une remise doit être appliquée en fonction de customer, currency et transaction. La règle vérifie si la prédiction correspond à la valeur réelle au moins 99 % du temps. Hypothèse : le modèle de ML est créé avant l'utilisation de la règle. Créez le modèle de ML à l'aide de la commande suivante :
CREATE MODEL
model-project-id.dataset-id.model-name
OPTIONS(model_type='logistic_reg') AS
SELECT
IF(discount_pct IS NULL, 0, 1) AS label,
IFNULL(customer_id, "") AS customer,
IFNULL(currency_id, "") AS currency,
IFNULL(amount, 0.0) AS amount
FROM
`data-project-id.dataset-id.table-names`
WHERE transaction_timestamp < '2022-01-01';
|
La règle suivante vérifie si la précision de la prédiction est supérieure à 99 %.
SELECT
accuracy > 0.99
FROM
ML.EVALUATE
(MODEL model-project-id.dataset-id.model-name,
(
SELECT
customer_id,
currency_id,
amount,
discount_pct
FROM
data-project-id.dataset-id.table-names
WHERE transaction_timestamp > '2022-01-01';
)
)
|
| Condition de ligne | Fonction de prédiction BigQuery ML permettant d'identifier les anomalies dans discount_pct. Elle vérifie si une remise doit être appliquée en fonction de customer, currency et transaction.
La règle identifie toutes les occurrences où la prédiction ne correspond pas.
Hypothèse : le modèle de ML est créé avant l'utilisation de la règle. Créez le modèle de ML à l'aide de la commande suivante :
CREATE MODEL
model-project-id.dataset-id.model-name
OPTIONS(model_type='logistic_reg') AS
SELECT
IF(discount_pct IS NULL, 0, 1) AS label,
IFNULL(customer_id, "") AS customer,
IFNULL(currency_id, "") AS currency,
IFNULL(amount, 0.0) AS amount
FROM
`data-project-id.dataset-id.table-names`
WHERE transaction_timestamp < '2022-01-01';
|
La règle suivante vérifie si la prédiction de remise correspond à la remise réelle pour chaque ligne.
IF(discount_pct > 0, 1, 0)
=(SELECT predicted_label FROM
ML.PREDICT(
MODEL model-project-id.dataset-id.model-name,
(
SELECT
customer_id,
currency_id,
amount,
discount_pct
FROM
data-project-id.dataset-id.table-names AS t
WHERE t.transaction_timestamp =
transaction_timestamp
LIMIT 1
)
)
)
|
| Assertion SQL | Valide si discount_pct est supérieur à 30 % pour la journée en cours en vérifiant s'il existe des lignes avec un pourcentage de remise inférieur ou égal à 30. |
SELECT * FROM my_project_id.dim_dataset.dim_currency WHERE discount_pct <= 30 AND transaction_timestamp >= current_date() |
| Assertion SQL (avec paramètre de référence de données) | Vérifie si Le filtre de date Le paramètre de référence de données |
SELECT * FROM ${data()} WHERE discount_pct > 30 |
Définir des règles de qualité des données à l'aide de la gcloud CLI
L'exemple de fichier YAML suivant utilise certaines des mêmes règles que les exemples de règles utilisant des types intégrés et les exemples de règles SQL personnalisées. Ce fichier YAML contient également d'autres spécifications pour l'analyse de la qualité des données, telles que les filtres et le pourcentage d'échantillonnage. Lorsque vous utilisez la gcloud CLI pour créer ou mettre à jour une analyse de la qualité des données, vous pouvez utiliser un fichier YAML tel que celui-ci comme entrée pour l'argument --data-quality-spec-file.
rules:
- uniquenessExpectation: {}
column: transaction_id
dimension: UNIQUENESS
- nonNullExpectation: {}
column: amount
dimension: COMPLETENESS
threshold: 1
- regexExpectation:
regex: '^[a-zA-Z]{8}[0-9]{16}$'
column : customer_id
ignoreNull : true
dimension : VALIDITY
threshold : 1
- setExpectation :
values :
- 'USD'
- 'JPY'
- 'INR'
- 'GBP'
- 'CAN'
column : currency_id
ignoreNull : true
dimension : VALIDITY
threshold : 1
- rangeExpectation:
minValue : '0'
maxValue : '100'
column : discount_pct
ignoreNull : true
dimension : VALIDITY
threshold : 1
- rowConditionExpectation:
sqlExpression : 0 < `discount_pct` AND `discount_pct` < 100
column: discount_pct
dimension: VALIDITY
threshold: 1
- rowConditionExpectation:
sqlExpression : currency_id in (select id from `my_project_id.dim_dataset.dim_currency`)
column: currency_id
dimension: VALIDITY
threshold: 1
- tableConditionExpectation:
sqlExpression : 30 < avg(discount_pct) AND avg(discount_pct) < 50
dimension: VALIDITY
- rowConditionExpectation:
sqlExpression : TIMESTAMP(transaction_timestamp) < CURRENT_TIMESTAMP()
column: transaction_timestamp
dimension: VALIDITY
threshold: 1
- sqlAssertion:
sqlStatement : SELECT * FROM `my_project_id.dim_dataset.dim_currency` WHERE discount_pct > 100
dimension: VALIDITY
debugQueries:
- sqlStatement: SELECT MAX(discount_pct) FROM `my_project_id.dim_dataset.dim_currency`
samplingPercent: 50
rowFilter: discount_pct > 100
postScanActions:
bigqueryExport:
resultsTable: projects/my_project_id/datasets/dim_dataset/tables/dim_currency
notificationReport:
recipients:
emails:
- '222larabrown@gmail.com'
- 'cloudysanfrancisco@gmail.com'
scoreThresholdTrigger:
scoreThreshold: 50
jobFailureTrigger: {}
jobEndTrigger: {}
catalogPublishingEnabled: true
Configurer l'identité d'exécution
Par défaut, les analyses de la qualité des données s'exécutent à l'aide du compte de service Knowledge Catalog. Vous pouvez remplacer ce paramètre pour utiliser un compte de service personnalisé ou vos propres identifiants utilisateur finaux.
L'utilisation d'une identité d'exécution personnalisée modifie la façon dont l'analyse vous est facturée. Lorsque vous spécifiez une identité d'exécution personnalisée, les coûts de calcul et de stockage associés à l'analyse sont facturés directement à votre projet BigQuery, en contournant les SKU Premium standards de Knowledge Catalog.
Autorisations requises pour les identités d'exécution personnalisées
Pour configurer un compte de service personnalisé ou utiliser des identifiants d'utilisateur final, vous devez disposer des autorisations Identity and Access Management (IAM) supplémentaires suivantes :
- Pour utiliser un compte de service personnalisé, vous devez disposer des éléments suivants :
- Autorisation
iam.serviceAccounts.actAsaccordée pour le projet contenant le compte de service (par exemple,roles/iam.serviceAccountUser). - L'agent de service de votre projet (
service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com) doit disposer de l'autorisationiam.serviceAccounts.getAccessTokensur le compte de service personnalisé (par exemple, en ayant le rôleroles/iam.serviceAccountTokenCreator). - Le compte de service personnalisé doit disposer de
bigquery.tables.getDatasur la table à analyser, debigquery.jobs.insertdans le projet d'analyse et debigquery.dataEditorsur l'ensemble de données d'exportation (si vous utilisez l'exportation).
- Autorisation
- Pour utiliser les identifiants de l'utilisateur final, vous avez besoin des éléments suivants :
bigquery.tables.getDatasur la table à analyser.bigquery.jobs.insertdans le projet d'analyse.bigquery.dataEditorsur l'ensemble de données à exporter (si vous utilisez l'exportation).
Pour configurer l'identité d'exécution, sélectionnez l'une des options suivantes :
Console
Pour configurer l'identité d'exécution dans la console Google Cloud , sélectionnez l'identité lorsque vous créez votre analyse de la qualité des données.
Dans la section Identité d'exécution, sélectionnez l'une des options suivantes :
- Agent de service Dataplex : comportement par défaut.
- Compte de service : saisissez l'adresse e-mail du compte de service que vous souhaitez utiliser.
- Identifiants utilisateur : utilisez vos propres identifiants pour exécuter l'analyse.
REST
Pour utiliser un compte de service personnalisé, ajoutez l'objet executionIdentity à la définition de ressource DataScan lors de la requête create :
"executionIdentity": { "serviceAccount": { "email": "YOUR_SERVICE_ACCOUNT_EMAIL" } }
Remplacez les éléments suivants :
YOUR_SERVICE_ACCOUNT_EMAIL: adresse e-mail du compte de service que vous souhaitez utiliser.
Pour utiliser les identifiants de l'utilisateur final, spécifiez plutôt l'objet userCredential :
"executionIdentity": { "userCredential": {} }
Créer une analyse de qualité des données
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur Créer une analyse de la qualité des données.
Dans la fenêtre Définir l'analyse, renseignez les champs suivants :
Facultatif : Saisissez un nom à afficher.
Saisissez un ID. Consultez les conventions d'attribution de noms pour les ressources.
Facultatif : Saisissez une description.
Dans le champ Table, cliquez sur Parcourir. Choisissez la table à analyser, puis cliquez sur Sélectionner. Seules les tables BigQuery standards, Iceberg REST Catalog, SAP BDC Delta et Hive sur Google CloudLakehouse sont acceptées.
Pour les tables des ensembles de données multirégionaux, choisissez une région dans laquelle créer l'analyse de données.
Pour parcourir les tables organisées dans les lacs Knowledge Catalog, cliquez sur Parcourir les lacs Knowledge Catalog.
Dans le champ Champ d'application, sélectionnez Incrémentiel ou Intégralité des données.
- Si vous choisissez Incrémentiel : dans le champ Colonne de code temporel, sélectionnez une colonne de type
DATEouTIMESTAMPdans votre table BigQuery qui augmente à mesure que de nouveaux enregistrements sont ajoutés et qui permet d'identifier de nouveaux enregistrements. Il peut s'agir d'une colonne qui partitionne la table.
- Si vous choisissez Incrémentiel : dans le champ Colonne de code temporel, sélectionnez une colonne de type
Facultatif : Pour filtrer vos données, cochez la case Filtrer les lignes. Fournissez un filtre de ligne constitué d'une expression SQL valide pouvant être utilisée dans une clause
WHEREen syntaxe GoogleSQL. Exemple :col1 >= 0. Le filtre peut être une combinaison de plusieurs conditions de colonne. Par exemple,col1 >= 0 AND col2 < 10.Pour échantillonner vos données, sélectionnez un pourcentage d'échantillonnage dans la liste Taille d'échantillonnage. Choisissez un pourcentage compris entre 0,0 et 100,0 %, avec un maximum de trois chiffres après la virgule. Pour les ensembles de données plus volumineux, choisissez un pourcentage d'échantillonnage plus faible. Par exemple, pour une table de 1 Po, si vous saisissez une valeur comprise entre 0,1 et 1 %, l'analyse de la qualité des données échantillonne entre 1 et 10 To de données. Pour les analyses de données incrémentielles, l'analyse de la qualité des données applique l'échantillonnage au dernier incrément.
Facultatif : Pour publier les résultats de l'analyse de la qualité des données en tant que métadonnées Knowledge Catalog, cochez la case Publier les résultats dans Knowledge Catalog.
Vous pouvez consulter les derniers résultats de l'analyse dans l'onglet Qualité des données des pages BigQuery et Knowledge Catalog pour la table source. Pour permettre aux utilisateurs d'accéder aux résultats d'analyse publiés, consultez la section Accorder l'accès aux résultats d'analyse de la qualité des données de ce document.
Pour Type d'identifiant, consultez Configurer l'identité d'exécution.
Pour créer une analyse de la qualité des données à l'aide de règles, sélectionnez Type de règle > Créer avec une règle basée sur les entrées.
Dans la section Planification, choisissez l'une des options suivantes :
Répétition : exécutez l'analyse de la qualité des données selon une planification horaire, quotidienne, hebdomadaire, mensuelle ou personnalisée. Spécifiez la fréquence et l'heure d'exécution de l'analyse. Si vous choisissez "Personnalisée", utilisez le format cron pour spécifier la planification.
À la demande : exécutez l'analyse de la qualité des données à la demande.
Exécution unique : exécutez l'analyse de la qualité des données une seule fois maintenant, puis supprimez-la après le délai de suppression automatique. Cette fonctionnalité est disponible en version bêta.
- Définir la suppression automatique des résultats d'analyse : le délai de suppression automatique correspond à la période entre l'exécution et la suppression de l'analyse. Une analyse de la qualité des données sans heure de suppression automatique spécifiée est automatiquement supprimée 24 heures après son exécution. La durée de suppression automatique peut aller de 0 seconde (suppression immédiate) à 365 jours.
Cliquez sur Continuer.
Dans la fenêtre Règles sur la qualité des données, définissez les règles à configurer pour cette analyse de la qualité des données.
Cliquez sur Ajouter des règles, puis sélectionnez l'une des options suivantes.
Recommandations basées sur les profils : créez des règles à partir des recommandations basées sur une analyse de profilage des données existante.
Sélectionner des colonnes : sélectionnez les colonnes pour lesquelles vous souhaitez obtenir des règles recommandées.
Sélectionner un projet d'analyse : si l'analyse de profilage des données se trouve dans un projet différent de celui dans lequel vous créez l'analyse de la qualité des données, sélectionnez le projet à partir duquel extraire les analyses de profilage.
Sélectionner des résultats de profil : sélectionnez un ou plusieurs résultats de profil, puis cliquez sur OK. Une liste de règles suggérées s'affiche. Vous pouvez l'utiliser comme point de départ.
Cochez les cases correspondant aux règles que vous souhaitez ajouter, puis cliquez sur Sélectionner. Une fois sélectionnées, les règles sont ajoutées à votre liste de règles actuelle. Vous pouvez ensuite modifier les règles.
Types de règles intégrés : créez des règles à partir de règles prédéfinies. Consultez la liste des règles prédéfinies.
Sélectionner des colonnes : sélectionnez les colonnes pour lesquelles vous souhaitez sélectionner des règles.
Choisir les types de règles : sélectionnez les types de règles que vous souhaitez choisir, puis cliquez sur OK. Les types de règles qui s'affichent dépendent des colonnes que vous avez sélectionnées.
Cochez les cases correspondant aux règles que vous souhaitez ajouter, puis cliquez sur Sélectionner. Une fois sélectionnées, les règles sont ajoutées à votre liste de règles actuelle. Vous pouvez ensuite modifier les règles.
Règle de vérification des lignes SQL : créez une règle SQL personnalisée à appliquer à chaque ligne.
Dans Dimension, choisissez une dimension.
Dans Seuil de réussite, choisissez le pourcentage d'enregistrements qui doivent réussir le contrôle.
Dans Nom de la colonne, sélectionnez une colonne.
Dans le champ Fournissez une expression SQL, saisissez une expression SQL qui renvoie la valeur booléenne
true(succès) oufalse(échec). Pour en savoir plus, consultez Types de règles SQL personnalisées compatibles et les exemples de la section Définir des règles de qualité des données.Cliquez sur Ajouter.
Règle de vérification des agrégations SQL : créez une règle de condition de table SQL personnalisée.
Dans Dimension, choisissez une dimension.
Dans Nom de la colonne, sélectionnez une colonne.
Dans le champ Fournissez une expression SQL, saisissez une expression SQL qui renvoie la valeur booléenne
true(succès) oufalse(échec). Pour en savoir plus, consultez Types de règles SQL personnalisées compatibles et les exemples de la section Définir des règles de qualité des données.Cliquez sur Ajouter.
Règle d'assertion SQL : créez une règle d'assertion SQL personnalisée pour vérifier si les données sont dans un état non valide.
Dans Dimension, choisissez une dimension.
Facultatif : dans Nom de la colonne, sélectionnez une colonne.
Dans le champ Fournissez une instruction SQL, saisissez une instruction SQL qui renvoie les lignes correspondant à l'état non valide. Si des lignes sont renvoyées, cette règle échoue. Omettez le point-virgule de fin de l'instruction SQL. Pour en savoir plus, consultez Types de règles SQL personnalisées compatibles et les exemples de la section Définir des règles de qualité des données.
Cliquez sur Ajouter.
Facultatif : Pour toute règle de qualité des données, vous pouvez attribuer un nom personnalisé à utiliser pour la surveillance et les alertes, ainsi qu'une description. Pour ce faire, modifiez une règle et spécifiez les informations suivantes :
- Nom de la règle : saisissez un nom de règle personnalisé de 63 caractères maximum. Le nom de la règle peut inclure des lettres (a-z, A-Z), des chiffres (0-9) et des traits d'union (-). Il doit commencer par une lettre et se terminer par un chiffre ou une lettre.
- Description : saisissez une description de la règle de 1 024 caractères maximum.
Répétez les étapes précédentes pour ajouter d'autres règles à l'analyse de la qualité des données. Lorsque vous avez terminé, cliquez sur Continuer.
Facultatif : Exportez les résultats de l'analyse vers une table BigQuery standard. Dans la section Exporter les résultats d'analyse dans une table BigQuery, procédez comme suit :
Dans le champ Sélectionnez un ensemble de données BigQuery, cliquez sur Parcourir. Sélectionnez un ensemble de données BigQuery dans lequel stocker les résultats de l'analyse de la qualité des données.
Dans le champ Table BigQuery, spécifiez la table dans laquelle stocker les résultats de l'analyse de la qualité des données. Si vous utilisez une table existante, assurez-vous qu'elle est compatible avec le schéma de la table d'exportation. Si la table spécifiée n'existe pas, Knowledge Catalog la crée pour vous.
Facultatif : Ajoutez des étiquettes. Les étiquettes sont des paires clé/valeur qui vous permettent de regrouper des objets associés ou de les combiner à d'autres Google Cloud ressources.
Facultatif : Configurez des rapports de notification par e-mail pour informer les utilisateurs de l'état et des résultats d'un job d'analyse de la qualité des données. Dans la section Rapport de notification, cliquez sur Ajouter un ID d'adresse e-mail et saisissez jusqu'à cinq adresses e-mail. Sélectionnez ensuite les scénarios pour lesquels vous souhaitez envoyer des rapports :
- Niveau de qualité (<=) : envoie un rapport lorsqu'un job réussit avec un niveau de qualité des données inférieur au niveau cible spécifié. Saisissez un score de qualité cible compris entre 0 et 100.
- Échecs de jobs : envoie un rapport en cas d'échec du job lui-même, quels que soient les résultats de la qualité des données.
- Achèvement de jobs (réussite ou échec) : envoie un rapport à la fin du job, quels que soient les résultats de la qualité des données.
Cliquez sur Créer.
Une fois l'analyse créée, vous pouvez l'exécuter à tout moment en cliquant sur Exécuter maintenant.
gcloud
Pour créer une analyse de la qualité des données, utilisez la commande gcloud dataplex datascans create data-quality.
Si les données source sont organisées dans un lac Knowledge Catalog, incluez l'indicateur --data-source-entity :
gcloud dataplex datascans create data-quality DATASCAN \
--location=LOCATION \
--data-quality-spec-file=DATA_QUALITY_SPEC_FILE \
--data-source-entity=DATA_SOURCE_ENTITY
Si les données source ne sont pas organisées dans un lac Knowledge Catalog, incluez le flag --data-source-resource :
gcloud dataplex datascans create data-quality DATASCAN \
--location=LOCATION \
--data-quality-spec-file=DATA_QUALITY_SPEC_FILE \
--data-source-resource=DATA_SOURCE_RESOURCE
Remplacez les variables suivantes :
DATASCAN: nom de l'analyse de la qualité des données.LOCATION: région Google Cloud dans laquelle créer l'analyse de la qualité des données.DATA_QUALITY_SPEC_FILE: chemin d'accès au fichier JSON ou YAML contenant les spécifications de l'analyse de la qualité des données. Il peut s'agir d'un fichier local ou d'un chemin d'accès Cloud Storage avec le préfixegs://. Utilisez ce fichier pour spécifier les règles de qualité des données pour l'analyse. Vous pouvez également spécifier des informations supplémentaires dans ce fichier, telles que des filtres, un pourcentage d'échantillonnage et des actions post-analyse (par exemple, l'exportation vers BigQuery ou l'envoi de rapports de notification par e-mail). Consultez la documentation sur la représentation JSON et l'exemple de représentation YAML.DATA_SOURCE_ENTITY: entité Knowledge Catalog contenant les données pour l'analyse de la qualité des données. Exemple :projects/test-project/locations/test-location/lakes/test-lake/zones/test-zone/entities/test-entity.DATA_SOURCE_RESOURCE: nom de la ressource contenant les données pour l'analyse de la qualité des données. Exemple ://bigquery.googleapis.com/projects/test-project/datasets/test-dataset/tables/test-table.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Node.js
Node.js
Avant d'essayer cet exemple, suivez les instructions de configuration pour Node.js du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Node.js.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
Pour créer une analyse de la qualité des données, utilisez la méthode dataScans.create.
La requête suivante crée une analyse ponctuelle de la qualité des données :
POST https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/dataScans?data_scan_id=DATASCAN_ID { "data": { "resource": "//bigquery.googleapis.com/projects/PROJECT_ID/datasets/DATASET_ID/tables/TABLE_ID" }, "type": "DATA_QUALITY", "executionSpec": { "trigger": { "oneTime": { "ttl_after_scan_completion": "120s" } } }, "dataQualitySpec": { "rules": [ { "nonNullExpectation": {}, "column": "COLUMN_NAME", "dimension": "DIMENSION", "threshold": 1 } ], "filter": "FILTER_CONDITION" } }
Remplacez les éléments suivants :
PROJECT_ID: ID de votre projetLOCATION: région dans laquelle créer l'analyse de la qualité des données.DATASCAN_ID: ID de l'analyse de la qualité des données.DATASET_ID: ID de l'ensemble de données BigQuery.TABLE_ID: ID de la table BigQuery.COLUMN_NAME: nom de la colonne pour la règle.DIMENSION: dimension de la règle, par exempleVALIDITY.FILTER_CONDITION: chaîne de filtre AIP-160 facultative permettant d'exécuter des règles de manière sélective (par exemple,name = \"RULE_NAME\").
Si vous souhaitez créer des règles pour l'analyse de la qualité des données à l'aide de recommandations de règles basées sur les résultats d'une analyse de profilage des données, obtenez les recommandations en appelant la méthode dataScans.jobs.generateDataQualityRules sur l'analyse de profilage des données.
Exporter le schéma de table
Pour exporter les résultats de l'analyse de la qualité des données vers une table BigQuery existante, assurez-vous qu'elle est compatible avec le schéma de table suivant :
| Nom de la colonne | Type de données de la colonne | Nom du sous-champ (le cas échéant) |
Type de données du sous-champ | Mode | Exemple |
|---|---|---|---|---|---|
| data_quality_scan | struct/record |
resource_name |
string |
nullable | //dataplex.googleapis.com/projects/test-project/locations/europe-west2/datascans/test-datascan |
project_id |
string |
nullable | dataplex-back-end-dev-project |
||
location |
string |
nullable | us-central1 |
||
data_scan_id |
string |
nullable | test-datascan |
||
display_name |
string |
nullable | datascan-display-name |
||
| data_source | struct/record |
resource_name |
string |
nullable | Cas d'entité ://dataplex.googleapis.com/projects/dataplex-back-end-dev-project/locations/europe-west2/lakes/a0-datascan-test-lake/zones/a0-datascan-test-zone/entities/table1Cas de table : //bigquery.googleapis.com/projects/test-project/datasets/test-dataset/tables/test-table
|
dataplex_entity_project_id |
string |
nullable | dataplex-back-end-dev-project |
||
dataplex_entity_project_number |
integer |
nullable | 123456789 |
||
dataplex_lake_id |
string |
nullable | (Valide uniquement si la source est une entité)test-lake
|
||
dataplex_zone_id |
string |
nullable | (Valide uniquement si la source est une entité)test-zone |
||
dataplex_entity_id |
string |
nullable | (Valide uniquement si la source est une entité)test-entity |
||
table_project_id |
string |
nullable | test-project |
||
table_project_number |
integer |
nullable | 987654321 |
||
dataset_id |
string |
nullable | (Valide uniquement si la source est une table)test-dataset |
||
table_id |
string |
nullable | (Valide uniquement si la source est une table)test-table |
||
| data_quality_job_id | string |
nullable | caeba234-cfde-4fca-9e5b-fe02a9812e38 |
||
| data_quality_job_configuration | json |
nullable | {"trigger": "ondemand", "incremental": true} |
||
| job_labels | json |
nullable | {"key1":value1} |
||
| job_start_time | timestamp |
nullable | 2023-01-01 00:00:00 UTC |
||
| job_end_time | timestamp |
nullable | 2023-01-01 00:00:00 UTC |
||
| job_quality_result | struct/record |
passed |
boolean |
nullable | true/false |
score |
float |
nullable | 90.8 |
||
incremental_start |
string |
nullable | 2023-01-01T00:00:00 |
||
incremental_end |
string |
nullable | 2024-01-01T00:00:00 |
||
| job_dimension_result | json |
nullable | {"ACCURACY":{"passed":true,"score":100},"CONSISTENCY":{"passed":false,"score":60}}
|
||
| job_rows_scanned | integer |
nullable | 7500 |
||
| rule_name | string |
nullable | test-rule |
||
| rule_description | string |
nullable | Test rule description |
||
| rule_type | string |
nullable | Range Check |
||
| rule_evaluation_type | string |
nullable | Per row |
||
| rule_column | string |
nullable | Rule only attached to a certain column |
||
| rule_dimension | string |
nullable | UNIQUENESS |
||
| rule_threshold_percent | float |
nullable | (0,0 à 100,0)Rule-threshold-pct in API * 100 |
||
| rule_parameters | json |
nullable | {min: 24, max:5345} |
||
| rule_passed | boolean |
nullable | true |
||
| rule_rows_evaluated | integer |
nullable | 7400 |
||
| rule_rows_passed | integer |
nullable | 3 |
||
| rule_rows_passed_percent | float |
nullable | (0.0-100.0)80.0 (indique 80%) |
||
| rule_rows_null | integer |
nullable | 4 |
||
| rule_failed_records_query | string |
nullable | "SELECT * FROM `test-project.test-dataset.test-table` WHERE (NOT((`cTime` >= '15:31:38.776361' and `cTime` <= '19:23:53.754823') IS TRUE));" |
||
| created_on | timestamp |
nullable | 2023-01-01 00:00:00 UTC |
||
| last_updated | timestamp |
nullable | 2023-01-01 00:00:00 UTC |
||
| rule_assertion_row_count | integer |
nullable | 10 |
||
| debug_queries | struct/record |
description |
string |
nullable | Test debug query description |
sql_statement |
string |
nullable | SELECT MIN(col1) AS min_col1, AVG(col1) FROM ${data()} |
||
debug_query_results |
struct/record |
repeated | [{"name": "min_col1", "type": "INTEGER", "value": "5"}, {"type": "FLOAT", "value": "7"}] |
||
↳ name |
string |
nullable | Nom de la colonne de résultat de la requête, comme min_col1 |
||
↳ type |
string |
nullable | Type de colonne de résultat de requête, par exemple INTEGER |
||
↳ value |
string |
nullable | Valeur de la colonne de résultat de la requête, comme 5 |
||
| rule_attributes | json |
nullable | {"key": "value"} |
||
| rule_source | struct/record |
rule_path_elements |
struct/record |
repeated | [{"entry_source": {"entry_type": "bigquery_table"}}] |
↳ entry_source |
struct/record |
nullable | {"entry_type": "bigquery_table"} |
||
↳ entry_type |
string |
nullable | bigquery_table |
||
↳ entry |
string |
nullable | projects/test-project/locations/us/entryGroups/@bigquery/entries/test-table |
||
↳ display_name |
string |
nullable | test-table |
||
↳ entry_link_source |
struct/record |
nullable | {"entry_link_type": "table_spec"} |
||
↳ entry_link_type |
string |
nullable | table_spec |
||
↳ entry_link |
string |
nullable | projects/test-project/locations/us/entryLinks/test-link |
Lorsque vous configurez BigQueryExport pour un job d'analyse de la qualité des données, suivez ces consignes :
- Pour le champ
resultsTable, utilisez le format suivant ://bigquery.googleapis.com/projects/{project-id}/datasets/{dataset-id}/tables/{table-id}. - Utilisez une table BigQuery standard.
- Si la table n'existe pas lorsque l'analyse est créée ou mise à jour, Knowledge Catalog la crée pour vous.
- Par défaut, la table est partitionnée quotidiennement sur la colonne
job_start_time. - Si vous souhaitez que la table soit partitionnée selon d'autres configurations ou si vous ne voulez pas la partition, recréez la table avec le schéma et les configurations requis, puis fournissez la table préalablement créée en tant que table de résultats.
- Assurez-vous que la table de résultats se trouve au même emplacement que la table source.
- Si VPC-SC est configuré dans le projet, la table de résultats doit se trouver dans le même périmètre VPC-SC que la table source.
- Si la table est modifiée lors de l'étape d'exécution de l'analyse, le job en cours d'exécution est exporté vers la table de résultats précédente et la modification de la table prend effet à partir du prochain job d'analyse.
- Ne modifiez pas le schéma de table. Si vous avez besoin de colonnes personnalisées, créez une vue sur la table.
- Pour réduire les coûts, définissez un délai d'expiration pour la partition en fonction de votre cas d'utilisation. Pour en savoir plus, découvrez comment définir le délai d'expiration de la partition.
Exécuter une analyse de la qualité des données
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur l'analyse de la qualité des données à exécuter.
Cliquez sur Exécuter maintenant.
gcloud
Pour exécuter une analyse de la qualité des données, utilisez la commande gcloud dataplex datascans run :
gcloud dataplex datascans run DATASCAN \ --location=LOCATION \
Remplacez les variables suivantes :
LOCATION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.DATASCAN: nom de l'analyse de la qualité des données.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
Pour exécuter une analyse de la qualité des données, utilisez la méthode dataScans.run :
Airflow
Pour exécuter une analyse de la qualité des données à l'aide d'un graphe orienté acyclique (DAG) dans Managed Service pour Apache Airflow (Cloud Composer), utilisez DataplexRunDataQualityScanOperator :
from datetime import datetime
from airflow import DAG
from airflow.providers.google.cloud.operators.dataplex import DataplexRunDataQualityScanOperator
with DAG(
"dataplex_auto_dq_scan",
start_date=datetime(2026, 1, 1),
schedule_interval="@daily",
catchup=False,
) as dag:
run_dq_scan = DataplexRunDataQualityScanOperator(
task_id="run_dataplex_dq_scan",
project_id="PROJECT_ID",
region="REGION",
data_scan_id="DATASCAN_ID",
)
Remplacez les éléments suivants :
PROJECT_ID: ID de votre projet Google Cloud .REGION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.DATASCAN_ID: ID de votre analyse de la qualité des données.
Annuler une tâche d'analyse de la qualité des données
Si un job d'analyse de la qualité des données s'exécute plus longtemps que prévu ou a été lancé avec une configuration incorrecte, vous pouvez l'annuler. Il s'agit d'une opération qui sera effectuée dans la mesure du possible.
Si le job est déjà dans un état final (par exemple, SUCCEEDED ou FAILED), la demande d'annulation est ignorée.
Rôles et autorisations nécessaires
Pour obtenir les autorisations nécessaires pour annuler un job d'analyse de la qualité des données, demandez à votre administrateur de vous accorder le rôle IAM Éditeur Dataplex (roles/dataplex.editor) ou Administrateur Dataplex DataScan (roles/dataplex.dataScanAdmin) sur votre projet.
Annuler une mission
Vous pouvez annuler une tâche d'analyse de la qualité des données en cours d'exécution ou en attente à l'aide de l'API REST.
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données.
Cliquez sur le nom de l'analyse de la qualité des données contenant le job que vous souhaitez annuler.
Dans l'onglet Historique des jobs, recherchez le job dont l'état est En cours d'exécution ou En attente.
Cliquez sur Annuler à côté de la tâche.
REST
Utilisez la méthode projects.locations.dataScans.jobs.cancel.
POST https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/dataScans/DATASCAN_ID/jobs/JOB_ID:cancel
Remplacez les éléments suivants :
PROJECT_ID: ID du projet.LOCATION: région où se trouve l'analyse des données.DATASCAN_ID: ID de l'analyse de données.JOB_ID: ID du job à annuler.
Afficher les résultats de l'analyse de la qualité des données
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur le nom d'une analyse de la qualité des données.
La section Présentation affiche des informations sur les jobs les plus récents, y compris la date d'exécution de l'analyse, le nombre d'enregistrements analysés dans chaque job, si tous les contrôles de qualité des données ont réussi, et s'il y a eu des échecs, le nombre de contrôles de qualité des données qui ont échoué.
La section Configuration de l'analyse de la qualité des données affiche des informations sur l'analyse.
Pour afficher des informations détaillées sur un job, comme les scores de qualité des données qui indiquent le pourcentage de règles réussies, les règles qui ont échoué et les journaux de job, cliquez sur l'onglet Historique des jobs. Cliquez ensuite sur un ID de job.
gcloud
Pour afficher les résultats d'un job d'analyse de la qualité des données, utilisez la commande gcloud dataplex datascans jobs describe :
gcloud dataplex datascans jobs describe JOB \ --location=LOCATION \ --datascan=DATASCAN \ --view=FULL
Remplacez les variables suivantes :
JOB: ID du job d'analyse de la qualité des données.LOCATION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.DATASCAN: nom de l'analyse de la qualité des données à laquelle appartient le job.--view=FULL: pour afficher le résultat du job d'analyse, spécifiezFULL.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
Pour afficher les résultats d'une analyse de la qualité des données, utilisez la méthode dataScans.get.
Afficher les résultats publiés
Si les résultats de l'analyse de la qualité des données sont publiés en tant que métadonnées Knowledge Catalog, vous pouvez consulter les derniers résultats de l'analyse sur les pages BigQuery et Knowledge Catalog de la consoleGoogle Cloud , dans l'onglet Qualité des données de la table source.
Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.
Recherchez la table, puis sélectionnez-la.
Cliquez sur l'onglet Qualité des données.
Les derniers résultats publiés s'affichent.
Afficher l'historique des résultats d'analyse
Knowledge Catalog enregistre l'historique des analyses de la qualité des données des 300 derniers jobs ou de l'année écoulée, selon la première échéance.
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur le nom d'une analyse de la qualité des données.
Cliquez sur l'onglet Historique des jobs.
L'onglet Historique des jobs fournit des informations sur les jobs passés, comme le nombre d'enregistrements analysés dans chaque job, l'état du job, l'heure à laquelle le job a été exécuté, et la réussite ou l'échec de chaque règle.
Pour afficher des informations détaillées sur un job, cliquez sur l'un des jobs de la colonne Job ID.
gcloud
Pour afficher l'historique des jobs d'analyse de qualité des données, utilisez la commande gcloud dataplex datascans jobs list :
gcloud dataplex datascans jobs list \ --location=LOCATION \ --datascan=DATASCAN \
Remplacez les variables suivantes :
LOCATION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.DATASCAN: nom de l'analyse de la qualité des données pour laquelle afficher les jobs historiques.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
Pour afficher l'historique des jobs d'analyse de la qualité des données, utilisez la méthode dataScans.jobs.list.
États des jobs
Les tâches d'analyse de données peuvent présenter les états suivants :
PENDING: la tâche est créée, mais n'a pas encore commencé à s'exécuter. Dans cet état, l'analyse configure activement l'infrastructure ou acquiert des emplacements. Cette phase peut prendre de 10 à 20 secondes ou plus, en fonction de la complexité du schéma et de la contention des ressources.RUNNING: le job est en cours d'exécution.CANCELING: la tâche est en cours d'annulation.CANCELLED: la tâche a bien été annulée.SUCCEEDED: la tâche s'est terminée avec succès. L'état d'achèvement peut être en retard sur l'achèvement réel de la requête (jusqu'à 60 secondes) en raison des étapes de post-traitement, telles que l'agrégation et la synchronisation des métadonnées.FAILED: la tâche échoue en raison d'une erreur. L'état d'achèvement peut être en retard sur l'achèvement réel de la requête (jusqu'à 60 secondes) en raison des étapes de post-traitement, telles que l'agrégation et la synchronisation des métadonnées.SUCCEEDED_WITH_ERRORS: le job s'est terminé avec succès, mais des erreurs se sont produites lors de l'exécution.
Bonnes pratiques de surveillance
Lorsque vous surveillez vos jobs d'analyse des données, tenez compte des bonnes pratiques suivantes :
Évitez l'interrogation agressive : évitez l'interrogation agressive (par exemple, en appelant
GetJobou l'équivalent toutes les une à cinq secondes). L'interrogation agressive gaspille le quota d'API et n'accélère pas les transitions d'état.Utilisez un intervalle exponentiel entre les tentatives : si l'interrogation répétitive est inévitable, utilisez un intervalle exponentiel entre les tentatives en commençant par 10 à 15 secondes.
Utilisez le découplage asynchrone basé sur les événements (recommandé) : au lieu d'interroger l'API de manière synchrone, utilisez des déclencheurs Eventarc qui écoutent les journaux d'audit Cloud (
cloudaudit.googleapis.com). Vous pouvez utiliser ces déclencheurs pour lancer des workflows en aval immédiatement après les événements de fin de tâche DataScan. Cette approche permet de contourner les limites d'interrogation de l'API, de préserver le quota et de réduire la latence perçue.
Accorder l'accès aux résultats d'analyse de la qualité des données
Pour permettre aux utilisateurs de votre organisation d'afficher les résultats d'analyse, procédez comme suit :
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur l'analyse de la qualité des données dont vous souhaitez partager les résultats.
Cliquez sur l'onglet Autorisations.
Procédez comme suit :
- Pour accorder l'accès à un compte principal, cliquez sur Accorder l'accès. Accordez le rôle Lecteur de données Dataplex DataScan au compte principal associé.
- Pour supprimer l'accès d'un compte principal, sélectionnez le compte principal pour lequel vous souhaitez supprimer le rôle Lecteur de données Dataplex DataScan. Cliquez sur > Supprimer l'accès, puis confirmez lorsque vous y êtes invité.
Définir des alertes dans Logging
Pour définir des alertes en cas d'échec de la qualité des données à l'aide des journaux dans Cloud Logging, procédez comme suit :
Console
Dans la console Google Cloud , accédez à l'explorateur de journaux de Logging.
Dans la fenêtre Requête, saisissez votre requête. Consultez des exemples de requêtes.
Cliquez sur Exécuter la requête.
Cliquez sur Créer une alerte. Un panneau latéral s'ouvre.
Saisissez le nom de votre règle d'alerte, puis cliquez sur Suivant.
Examinez la requête.
Cliquez sur Prévisualiser les journaux pour tester votre requête. Les journaux correspondant aux conditions s'affichent.
Cliquez sur Suivant.
Définissez le délai entre les notifications, puis cliquez sur Suivant.
Définissez qui doit être averti de l'alerte, puis cliquez sur Enregistrer pour créer la règle d'alerte.
Vous pouvez également configurer et modifier vos alertes en accédant à Monitoring > Alertes dans la consoleGoogle Cloud .
gcloud
Non compatible
REST
Découvrez comment configurer des alertes dans Logging.
Exemples de requêtes pour configurer des alertes au niveau du job ou de la dimension
Exemple de requête permettant de définir des alertes en cas d'échec de la qualité globale des données pour une analyse de la qualité des données :
resource.type="dataplex.googleapis.com/DataScan" AND labels."dataplex.googleapis.com/data_scan_state"="SUCCEEDED" AND resource.labels.resource_container="projects/112233445566" AND resource.labels.datascan_id="a0-test-dec6-dq-3" AND NOT jsonPayload.dataQuality.passed=trueExemple de requête permettant de définir des alertes en cas d'échec de la qualité des données pour une dimension (par exemple, l'unicité) d'une analyse de la qualité des données spécifique :
resource.type="dataplex.googleapis.com/DataScan" AND labels."dataplex.googleapis.com/data_scan_state"="SUCCEEDED" AND resource.labels.resource_container="projects/112233445566" AND resource.labels.datascan_id="a0-test-dec6-dq-3" AND jsonPayload.dataQuality.dimensionPassed.UNIQUENESS=falseExemple de requête permettant de configurer des alertes en cas d'échec de la qualité des données pour une table.
Définissez des alertes en cas d'échec de la qualité des données pour une table BigQuery qui n'est pas organisée dans un lac Knowledge Catalog :
resource.type="dataplex.googleapis.com/DataScan" AND jsonPayload.dataSource="//bigquery.googleapis.com/projects/test-project/datasets/testdataset/table/chicago_taxi_trips" AND labels."dataplex.googleapis.com/data_scan_state"="SUCCEEDED" AND resource.labels.resource_container="projects/112233445566" AND NOT jsonPayload.dataQuality.passed=trueDéfinissez des alertes en cas d'échec de la qualité des données pour une table BigQuery organisée dans un lac Knowledge Catalog :
resource.type="dataplex.googleapis.com/DataScan" AND jsonPayload.dataSource="projects/test-project/datasets/testdataset/table/chicago_taxi_trips" AND labels."dataplex.googleapis.com/data_scan_state"="SUCCEEDED" AND resource.labels.resource_container="projects/112233445566" AND NOT jsonPayload.dataQuality.passed=true
Exemples de requêtes pour définir des alertes par règle
Exemple de requête permettant de définir des alertes pour toutes les règles de qualité des données en échec avec le nom de règle personnalisée spécifié pour une analyse de la qualité des données :
resource.type="dataplex.googleapis.com/DataScan" AND jsonPayload.ruleName="custom-name" AND jsonPayload.result="FAILED"Exemple de requête permettant de définir des alertes pour toutes les règles de qualité des données en échec d'un type d'évaluation spécifique pour une analyse de la qualité des données :
resource.type="dataplex.googleapis.com/DataScan" AND jsonPayload.evalutionType="PER_ROW" AND jsonPayload.result="FAILED"Exemple de requête permettant de définir des alertes pour toutes les règles de qualité des données en échec pour une colonne dans la table utilisée pour une analyse de la qualité des données :
resource.type="dataplex.googleapis.com/DataScan" AND jsonPayload.column="CInteger" AND jsonPayload.result="FAILED"
Résoudre un échec de qualité des données
Pour chaque job avec des règles au niveau des lignes qui échouent, Knowledge Catalog fournit une requête permettant d'obtenir les enregistrements ayant échoué. Exécutez cette requête pour afficher les enregistrements qui ne correspondaient pas à votre règle.
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur le nom de l'analyse de la qualité des données dont vous souhaitez résoudre les enregistrements ayant échoué.
Cliquez sur l'onglet Historique des jobs.
Cliquez sur l'ID du job qui a identifié des échecs de qualité des données.
Dans la fenêtre des résultats du job qui s'ouvre, dans la section Règles, recherchez la colonne Requête d'obtention des enregistrements ayant échoué. Cliquez sur Copier la requête dans le presse-papiers pour la règle ayant échoué.
Exécutez la requête dans BigQuery pour afficher les enregistrements qui ont entraîné l'échec du job.
gcloud
Non compatible
REST
Pour obtenir le job qui a identifié les échecs de qualité des données, utilisez la méthode
dataScans.get.Dans l'objet de réponse, le champ
failingRowsQueryaffiche la requête.Exécutez la requête dans BigQuery pour afficher les enregistrements qui ont entraîné l'échec du job.
Knowledge Catalog exécute également la requête de débogage, à condition qu'elle ait été incluse lors de la création de la règle. Les résultats de la requête de débogage sont inclus dans la sortie de chaque règle. Cette fonctionnalité est disponible en version bêta.
Console
Non compatible
gcloud
Non compatible
REST
Pour obtenir le job qui a identifié les échecs de qualité des données, utilisez la méthode dataScans.get.
Dans l'objet de réponse, le champ debugQueriesResultSets affiche les résultats des requêtes de débogage.
Gérer les analyses de qualité des données pour une table spécifique
Les étapes décrites dans ce document expliquent comment gérer les analyses de profilage des données dans votre projet à l'aide de la page Qualité et profilage des données de Knowledge Catalog dans la console Google Cloud .
Vous pouvez également créer et gérer des analyses de profilage de données lorsque vous travaillez avec une table spécifique. Dans la console Google Cloud , sur la page Knowledge Catalog de la table, utilisez l'onglet Qualité des données. Procédez comme suit :
Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.
Recherchez la table, puis sélectionnez-la.
Cliquez sur l'onglet Qualité des données.
Selon que la table dispose ou non d'une analyse de la qualité des données dont les résultats sont publiés en tant que métadonnées Knowledge Catalog, vous pouvez travailler avec les analyses de la qualité des données de la table de différentes manières :
Les résultats de l'analyse de la qualité des données sont publiés : les derniers résultats de l'analyse s'affichent sur la page.
Pour gérer les analyses de la qualité des données pour cette table, cliquez sur Analyse de la qualité des données, puis sélectionnez l'une des options suivantes :
Créer une analyse : créez une analyse de la qualité des données. Pour en savoir plus, consultez la section Créer une analyse de la qualité des données de ce document. Lorsque vous créez une analyse à partir de la page d'informations d'une table, celle-ci est présélectionnée.
Exécuter : exécutez l'analyse.
Modifier la configuration de l'analyse : modifiez les paramètres, y compris le nom à afficher, les filtres et la planification.
Pour modifier les règles sur la qualité des données, cliquez sur l'onglet Qualité des données, puis sur l'onglet Règles. Cliquez sur Modifier les règles. Modifiez les règles, puis cliquez sur Enregistrer.
Gérer les autorisations d'analyse : contrôlez qui peut accéder aux résultats de l'analyse. Pour en savoir plus, consultez la section Accorder l'accès aux résultats de l'analyse de la qualité des données de ce document.
Afficher l'historique des résultats : affichez des informations détaillées sur les jobs d'analyse de la qualité des données précédents. Pour en savoir plus, consultez les sections Afficher les résultats d'analyse de la qualité des données et Afficher l'historique des résultats d'analyse de ce document.
Afficher toutes les analyses : affichez la liste des analyses de qualité des données qui s'appliquent à cette table.
Les résultats de l'analyse de la qualité des données ne sont pas publiés : sélectionnez l'une des options ci-dessous.
Créer une analyse de la qualité des données : créez une analyse de la qualité des données. Pour en savoir plus, consultez la section Créer une analyse de la qualité des données de ce document. Lorsque vous créez une analyse à partir de la page d'informations d'une table, celle-ci est présélectionnée.
Afficher les analyses existantes : affichez la liste des analyses de qualité des données qui s'appliquent à cette table.
Mettre à jour une analyse de la qualité des données
Vous pouvez modifier différents paramètres d'une analyse de la qualité des données existante, comme le nom à afficher, les filtres, la planification et les règles de qualité des données.
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur le nom d'une analyse de la qualité des données.
Pour modifier les paramètres, y compris le nom à afficher, les filtres et la planification, cliquez sur Modifier. Modifiez les valeurs, puis cliquez sur Enregistrer.
Pour modifier les règles sur la qualité des données, cliquez sur l'onglet Règles actuelles sur la page des détails de l'analyse. Cliquez sur Modifier les règles. Modifiez les règles, puis cliquez sur Enregistrer.
gcloud
Pour modifier la description d'une analyse de la qualité des données, utilisez la commande gcloud dataplex datascans update data-quality :
gcloud dataplex datascans update data-quality DATASCAN \ --location=LOCATION \ --description=DESCRIPTION
Remplacez les éléments suivants :
DATASCAN: nom de l'analyse de la qualité des données à mettre à jour.LOCATION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.DESCRIPTION: nouvelle description de l'analyse de la qualité des données.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
Pour modifier une analyse de la qualité des données, utilisez la méthode dataScans.patch.
Supprimer une analyse de la qualité des données
Console
Console
Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.
Cliquez sur l'analyse que vous souhaitez supprimer.
Cliquez sur Supprimer, puis confirmez l'opération lorsque vous y êtes invité.
gcloud
gcloud
Pour supprimer une analyse de la qualité des données, utilisez la commande gcloud dataplex datascans delete :
gcloud dataplex datascans delete DATASCAN \ --location=LOCATION \ --async
Remplacez les variables suivantes :
DATASCAN: nom de l'analyse de la qualité des données à supprimer.LOCATION: région Google Cloud dans laquelle l'analyse de la qualité des données a été créée.
C#
C#
Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Go
Go
Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Java
Java
Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Python
Python
Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Ruby
Ruby
Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.
Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
REST
REST
Pour supprimer une analyse de la qualité des données, utilisez la méthode dataScans.delete :
Étapes suivantes
- Suivez un tutoriel pour créer un workflow de qualité des données "policy-as-code".
- Suivez un tutoriel pour gérer les règles de qualité des données en tant que code avec Terraform.
- Apprenez-en plus sur le profilage des données.
- Découvrez comment utiliser le profilage des données.