Probleme mit der Datenabfolge beheben

In diesem Dokument erfahren Sie, wie Sie die häufigsten Probleme beheben können, wenn keine Datenabstammungsdiagramme im Knowledge Catalog (ehemals Dataplex Universal Catalog) angezeigt werden. Wenn Sie diese Probleme beheben, können Sie Datenbewegungen nachvollziehen, Datenquellen ermitteln und Datenpipelines debuggen.

Projekttypen

Daten-Assets können sich in verschiedenen Projekten befinden. Im Folgenden finden Sie eine Zusammenfassung der möglichen Projekte und ihrer Asset-Namen.

BigQuery-Speicherprojekt

In diesem Projekt werden Ihre BigQuery-Daten-Assets gespeichert. Sie finden sie in den Asset-Details als Teil von Table ID vor dem ersten Punkt.

In der BigQuery-Benutzeroberfläche wird der Name des Speicherprojekts im Feld „Tabellen-ID“ vor dem ersten Punkt im voll qualifizierten Tabellennamen angezeigt.
Abbildung 1. Der Name eines BigQuery-Speicherprojekts.

Compute-Projekt

In diesem Projekt werden die Metadaten zum Datenursprung gespeichert. In BigQuery führen Sie hier einen Job aus. Wenn Sie einen Job über die Google Cloud -Konsole ausführen, finden Sie den Namen des Compute-Projekts in der Projektauswahl:

In der BigQuery-Benutzeroberfläche wird auf der Seite, auf der Sie SQL-Abfragen ausführen, ein Compute-Projekt namens „docs-compute“ angezeigt.
Abbildung 2. Der Name eines Compute-Projekts, in dem BigQuery-Jobs ausgeführt werden.

Geben Sie beim Senden von Anfragen an die BigQuery API das Compute-Projekt in der URL an, z. B.:

POST /bigquery/v2/projects/docs-compute/jobs HTTP/1.1
Host: bigquery.googleapis.com
User-Agent: Go-http-client/1.1
Authorization: <REDACTED 1031 BYTES>
Accept-Encoding: gzip
{
  "configuration": {
    "query": {
      "useLegacySql": false,
      "query": "CREATE OR REPLACE TABLE `docs-target.dataset.target-002` AS SELECT * FROM `docs-source.dataset.source-002`;"
    }
  },
  "jobReference": {
    "projectId": "docs-compute",
    "jobId": "docs-compute-job-id",
    "location": "us",
  }
}

Aktives Projekt

Dies ist das Projekt, in dem Sie die Datenherkunft ansehen. In der Google Cloud -Console wird das aktive Projekt in der Projektauswahl angezeigt. Wenn Sie die API verwenden, ist das aktive Projekt das Projekt, aus dem Sie API-Aufrufe ausführen.

In der BigQuery-Benutzeroberfläche wird der Datenursprung für ein Dataset mit dem Namen „source-001“ angezeigt, das sich in einem Projekt mit dem Namen „docs-source“ befindet.
Abbildung 3: Das aktive Projekt in der Google Cloud Console.

BigQuery-Datenherkunft wird nicht angezeigt

Das folgende Problem tritt nach dem Ausführen eines BigQuery-Jobs auf. In diesem Fall kann das Problem drei Ursachen haben:

  • Die Data Lineage API ist im aktiven Projekt oder im Compute-Projekt deaktiviert.
  • Sie haben nicht die Rolle Data Lineage Viewer (roles/datalineage.viewer) im aktiven oder im Compute-Projekt.
  • Die Datenherkunft ist noch nicht verfügbar. Je nach Menge und Komplexität der verarbeiteten Daten kann es zwischen 30 Minuten und 24 Stunden dauern, bis der Datenursprung angezeigt wird.

Wenn die Meldung „Herkunft konnte aufgrund fehlender Berechtigungen nicht abgerufen werden.“ angezeigt wird, fehlen Ihnen Berechtigungen für das aktive Projekt. Andernfalls fehlen Ihnen Berechtigungen für das Compute-Projekt.

Ein leeres Herkunftsdiagramm.
Abbildung 4: Beispiel für einen Fall, in dem die Herkunft nicht in der BigQuery-Benutzeroberfläche angezeigt wird.

Prüfen Sie zur Behebung dieses Problems, ob die Data Lineage API für das Compute-Projekt aktiviert ist. Nachdem Sie die API aktiviert haben, müssen Sie einen Job ausführen, um die Datenherkunft zu sehen. Je nach Menge und Komplexität der zu verarbeitenden Daten kann es zwischen 30 Minuten und 24 Stunden dauern, bis der Datenursprung angezeigt wird.

Prüfen Sie als Nächstes, ob die Data Lineage API für das aktive Projekt aktiviert ist.

Wenn die Data Lineage API aktiviert ist, weisen Sie die Rolle „Data Lineage Viewer“ (roles/datalineage.viewer) sowohl dem aktiven als auch dem Compute-Projekt zu.

BigQuery-Prozessmetadaten werden nicht angezeigt

Das folgende Problem tritt auf, wenn Sie den Detailbereich der Tabelle öffnen. Dort werden nicht alle Details wie die SQL-Anweisung oder die Property Process type angezeigt. Das passiert, obwohl die Datenherkunft korrekt angezeigt wird.

Das kann passieren, wenn Sie nicht berechtigt sind, Metadaten im Compute-Projekt anzusehen.

Beispiel:

  • BigQuery-Quelltabelle: docs-source.dataset.source-001
  • BigQuery-Zieltabelle: docs-target.dataset.target-001
  • Data Lineage zwischen docs-source.dataset.source-001 und docs-target.dataset.target-001 im Compute-Projekt docs-compute
  • Sie haben die Rolle Data Lineage Viewer für die aktiven und Compute-Projekte docs-compute.

Wenn Sie auf die BigQuery-Prozessdetails klicken, wird in der Google Cloud Console die folgende Meldung angezeigt:

You don't have permission to view BigQuery process metadata in project X.
In der BigQuery-Benutzeroberfläche wird im Detailbereich auf dem Tab „Lineage“ eine Fehlermeldung angezeigt.
Abbildung 5. Beispiel dafür, dass BigQuery-Prozessdetails nicht in der BigQuery-Benutzeroberfläche angezeigt werden.

Um dieses Problem zu beheben, weisen Sie dem Nutzer im Compute-Projekt die Berechtigung bigquery.jobs.get zu, die beispielsweise in der Rolle BigQuery-Ressourcenbetrachter enthalten ist.

BigQuery-Tabellendetails werden nicht angezeigt

Das folgende Problem tritt auf, wenn Sie den Bereich mit den Tabellendetails öffnen, in dem nur die Property Fully qualified name angezeigt wird. Das passiert, obwohl die Datenherkunft richtig angezeigt wird. Das kann passieren, wenn Sie nicht alle erforderlichen Berechtigungen in den Speicherprojekten der Tabelle haben.

Beispiel:

  • BigQuery-Tabelle docs-source.dataset.source-001
  • BigQuery-Tabelle docs-target.dataset.target-001
  • Data Lineage zwischen docs-source.dataset.source-001 und docs-target.dataset.target-001 mit Compute-Projekt docs-compute
  • Sie haben die Rolle Data Lineage Viewer für die aktiven und Compute-Projekte docs-compute.

Wenn Sie in diesem Fall auf die Details des BigQuery-Knotens klicken, wird die Meldung Entry with this fully qualified name is not available in Knowledge Catalog or you do not have permissions to view it angezeigt.

Details zur BigQuery-Tabelle werden nicht angezeigt.
Abbildung 6: Beispiel für BigQuery-Tabellendetails, die nicht in der BigQuery-Benutzeroberfläche angezeigt werden.

Um dieses Problem zu beheben, müssen Sie die Berechtigung bigquery.tables.get (z. B. in der Rolle BigQuery-Datenbetrachter enthalten) im Storage-Projekt gewähren.

Bei der Herkunft auf Spaltenebene wird die Meldung „Es sind keine Spalten zum Auswählen vorhanden“ angezeigt.

Das folgende Problem tritt auf, wenn Sie ein Asset in der Google Cloud Konsole aufrufen und das Lineage-Diagramm auf Tabellenebene richtig angezeigt wird, aber beim Auswählen von Lineage auf Spaltenebene die Meldung „Es sind keine Spalten zum Auswählen vorhanden“ angezeigt wird oder keine Spalten-zu-Spalten-Verknüpfungen zu sehen sind.

Dieses Problem kann in den folgenden Szenarien auftreten:

  • Benutzerdefinierte OpenLineage-Ereignisse:Ereignisse, die über den ProcessOpenLineageRunEvent-Endpunkt der Data Lineage API aufgenommen werden, unterstützen nur den Datenfluss auf Tabellenebene. Benutzerdefinierte Facetten auf Spaltenebene werden nicht in derGoogle Cloud Console gerendert.
  • Nicht unterstützte Datenquellen oder Systeme:Herkunftsgraphen auf Spaltenebene werden nur für BigQuery SQL-Transformationen und Managed Service for Apache Spark-Jobs generiert. Andere integrierte Systeme wie Cloud Data Fusion und Vertex AI unterstützen nur den Datenursprung auf Tabellenebene.
  • Nicht unterstützte BigQuery-Jobtypen:Die Herkunft auf Spaltenebene wird nicht für Ladejobs, Kopierjobs oder Routinen in BigQuery erfasst.
  • Externe Tabellen:Für externe Tabellen werden keine Upstream-Abstammungsinformationen auf Spaltenebene erfasst.
  • Unstrukturierte Assets oder Assets auf Speicherebene:Obwohl dateibasierte Assets (z. B. Cloud Storage-Rohdateien oder -Buckets) in der Regel nicht strukturiert sind, können in der Datenherkunft Spalten für sie angezeigt werden, wenn die Herkunft auf Spaltenebene an das System gemeldet wird. Wenn die Herkunft auf Spaltenebene für das Datei-Asset nicht angegeben ist, können Sie keine Spalten auswählen.
  • Komplexe verschachtelte Typen:Die Herkunft auf Spaltenebene wird nur für Spalten der obersten Ebene erfasst. Sie können keine Felder auswählen, die in komplexen Datentypen (z. B. STRUCT oder JSON) verschachtelt sind.
  • Pseudospalten für die Partitionierung:Systempartitionierungsspalten wie _PARTITIONDATE und _PARTITIONTIME werden in Herkunftsgraphen auf Spaltenebene nicht erkannt.
  • Linklimits überschritten:Wenn bei einem Transformationsjob mehr als 1.500 Links auf Spaltenebene generiert werden, überspringt Knowledge Catalog die Erfassung der Herkunft auf Spaltenebene und behält nur die Herkunft auf Tabellenebene bei.
  • Organisationsübergreifende Assets:Wenn ein Lineage-Pfad ein Asset in einer anderen Organisation durchläuft, können Sie nicht auf die Schema- und Spaltendetails zugreifen, wenn Sie nicht derselben Organisation wie das Asset angehören.

Unerwartete Gebühren für die Premium-Verarbeitung im Knowledge Catalog

Sie haben die Dataplex API (dataplex.googleapis.com) deaktiviert, um Gebühren zu vermeiden, sehen aber weiterhin tägliche Gebühren für die SKU „Knowledge Catalog Premium Processing“.

Dieses Problem kann auftreten, wenn die Data Lineage API (datalineage.googleapis.com) aktiviert bleibt. Die Data Lineage API wird unter der SKU „Knowledge Catalog Premium Processing“ abgerechnet, aber in der Google Cloud Console als separate API verwaltet. Wenn Sie die Dataplex API deaktivieren, wird die Data Lineage API nicht deaktiviert und die Gebühren dafür werden nicht eingestellt.

Wenn Sie feststellen möchten, ob die Gebühren auf die Datenherkunft zurückzuführen sind, suchen Sie in Ihrem Cloud Billing-Bericht nach dem Label goog-dataplex-workload-type mit dem Wert LINEAGE.

Um die Gebühren zu vermeiden, deaktivieren Sie die Data Lineage, indem Sie die Data Lineage API in Ihren Projekten deaktivieren.