Acerca de los metadatos en Knowledge Catalog

Knowledge Catalog (anteriormente, Dataplex Universal Catalog) proporciona una plataforma unificada y estructurada de administración de metadatos en todo tu patrimonio de datos distribuidos. Descubre, indexa y organiza automáticamente las estructuras técnicas, el contexto empresarial, las métricas de calidad de los datos y las relaciones operativas.

Al organizar los metadatos en un metamodelo flexible y extensible, Knowledge Catalog establece la base estructural del gráfico de contexto activo dentro de la nube de datos con agentes de Google. Este gráfico de contexto permite que los equipos de datos descubran y administren recursos, y, al mismo tiempo, permite que los agentes de IA generativa recuperen contexto empresarial fundamentado y confiable.

Metamodelo de Knowledge Catalog

Knowledge Catalog organiza los metadatos a través de una jerarquía modular de contenedores, recursos, esquemas y relaciones:

  • Contenedores y recursos: Los grupos de entradas organizan las entradas, que representan recursos de datos individuales y sus columnas de esquema.
  • Enriquecimiento estructurado: Los tipos de aspectos definen esquemas para los aspectos, que adjuntan metadatos estructurados a las entradas, las columnas o las relaciones.
  • Estándares y gobernanza: Los tipos de entrada definen plantillas que aplican aspectos obligatorios en las entradas.
  • Relaciones: Los tipos de vínculos de entrada definen relaciones (vínculos de entrada) que conectan entradas y términos comerciales relacionados.

En la siguiente tabla, se resume la distinción entre los recursos administrados por el sistema (proporcionados automáticamente por Google Cloud) y los recursos personalizados definidos por el usuario:

Elemento de metamodelo Administrado por el sistema (integrado) Definido por el usuario (personalizado)
Grupos de entradas Se predefine por proyecto para los servicios de Google Cloud (por ejemplo, @bigquery, @spanner, @pubsub). Los usuarios los crean para agrupar y administrar los permisos y los recursos de datos personalizados.
Entradas Se completa automáticamente a partir de fuentes Google Cloud (como tablas, vistas, conjuntos de datos y modelos de BigQuery). Los usuarios los crean para representar fuentes de datos, archivos o bases de datos de terceros personalizados.
Tipos de aspectos Plantillas del sistema predefinidas (por ejemplo, Schema, Overview, Contacts, DataQuality, Lineage). Los usuarios los crean para definir esquemas de metadatos específicos del dominio (como la clasificación de PII o los niveles de SLA).
Aspectos Se completa automáticamente a partir de los sistemas fuente, los registros de consultas o los análisis automatizados. Son creados por usuarios, canalizaciones o agentes, y se adjuntan a entradas, columnas o vínculos de entrada.
Tipos de entrada Son plantillas predefinidas que representan tipos de recursos Google Cloud . Los usuarios los definen para especificar aspectos obligatorios y opcionales de los recursos de datos personalizados.
Vínculos de entrada Tipos de relaciones integrados (como synonym, definition, schema-join, related) Instancias creadas entre entradas o columnas específicas para modelar conexiones entre sistemas.

En las siguientes secciones, se describen los componentes principales que conforman el metamodelo de Knowledge Catalog.

Grupos de entrada

Un grupo de entrada (EntryGroup) es un contenedor regional para entradas y vínculos de entrada que actúa como límite administrativo y de seguridad para administrar esos recursos.

Usa grupos de entradas para configurar lo siguiente:

  • Control de acceso de Identity and Access Management: Otorga permisos de lectura o edición a equipos específicos en un grupo de entradas sin modificar los permisos de entradas individuales.
  • Atribución de ubicación y proyecto: Agrupa los recursos por región geográfica y propiedad del proyecto.

En el caso de las fuentes de Google Cloud , Knowledge Catalog crea automáticamente grupos de entradas del sistema por proyecto (como @bigquery o @spanner). En el caso de las fuentes de datos personalizadas, debes crear grupos de entradas personalizados.

Por ejemplo, un equipo de finanzas puede crear un grupo de entradas personalizado llamado production_finance_data para administrar los permisos de acceso de todas las entradas personalizadas relacionadas con las finanzas en una sola ubicación.

Son grupos de entradas que contienen entradas y vínculos entre ellas. Son grupos de entradas que contienen entradas y vínculos entre ellas.
Figura 1. Grupos de entrada, entradas y vínculos de entrada (haz clic para ampliar).

Para obtener más información, consulta Grupos de entradas.

Entradas y rutas de esquemas

Una entrada (Entry) representa un solo activo de datos. Una entrada puede representar una tabla de base de datos estructurada, un modelo analítico, una tabla de objetos no estructurada o un conjunto de datos externo personalizado.

Entre los componentes clave de una entrada, se incluyen los siguientes:

  • Identificador de entrada: Es un nombre de recurso único dentro de su grupo de entradas principal.
  • Tipo de entrada: Es la plantilla que define la estructura de la entrada y los aspectos obligatorios.
  • Aspectos: Son atributos de metadatos estructurados adjuntos a la entrada.
  • Rutas de acceso al esquema (columnas): Son las subsecciones o los campos específicos dentro del activo de datos, como una columna en una tabla de BigQuery o un campo en un esquema JSON.

Las columnas te permiten adjuntar metadatos a campos individuales dentro de un activo. No defines columnas de forma manual; se propagan cuando adjuntas un aspecto de tipo schema a una entrada. Puedes hacer referencia a los campos anidados con rutas de acceso de notación de puntos (por ejemplo, customer.address.postal_code).

Por ejemplo, una tabla de BigQuery llamada orders_project.sales.customer_orders se representa como una entrada. Para describir el campo email_address dentro de esa tabla como que contiene información sensible, adjunta un aspecto de clasificación directamente a la ruta de acceso de la columna email_address.

Para obtener más información, consulta Entradas.

Tipos de aspecto

Un tipo de aspecto (AspectType) es una plantilla de esquema reutilizable que define los campos, los tipos de datos y las reglas de validación de un aspecto. Cada aspecto es una instancia de un tipo de aspecto.

Los tipos de aspectos pueden ser definidos por el sistema (proporcionados por Google Cloud) o personalizados (creados por tu organización).

Cuando defines el metadata_template para un tipo de aspecto personalizado, puedes usar los siguientes tipos de datos admitidos:

Tipo de datos del campo Descripción Ejemplo de caso de uso
string Valor de texto (UTF-8) Correo electrónico del propietario, etiqueta de clasificación de datos y nombre del departamento.
integer/number Valores numéricos (números enteros o de punto flotante) Días de retención de datos, porcentaje objetivo del ANS y clasificación de prioridad.
boolean Es una marca de verdadero o falso. contains_pii: true, is_certified: false.
enum Es una lista predefinida de valores de cadena permitidos. Entorno: ["DEV", "STAGING", "PROD"].
datetime/timestamp Fecha y hora con formato ISO 8601. Fecha de certificación más reciente y fecha límite de la revisión de cumplimiento.
record Es un objeto estructurado anidado que contiene campos secundarios. ContactInfo { name: string, email: string, phone: string }
array Es una lista de valores repetidos de cualquier tipo primitivo o de registro. Lista de propietarios de datos secundarios: ["user1@example.com", "user2@example.com"].
map Son pares clave-valor de cadena para atributos extensibles. Etiquetas de implementación personalizadas: {"cost_center": "1042", "tier": "gold"}.

Por ejemplo, para definir una plantilla reutilizable para la información de contacto, puedes crear un tipo de aspecto llamado ContactInfo con campos para owner_name (string), email (string) y support_channel (string).

Son los tipos de aspectos que definen los aspectos adjuntos a las entradas y los tipos de entrada que requieren tipos de aspectos. Son los tipos de aspectos que definen los aspectos adjuntos a las entradas y los tipos de entrada que requieren tipos de aspectos.
Figura 2. Tipos de aspectos, aspectos y tipos de entrada (haz clic para ampliar).

Para obtener más información, consulta Tipos de aspectos.

Aspectos

Un aspecto (Aspect) es un conjunto de campos de metadatos relacionados que se ajustan a un tipo de aspecto. Los aspectos se adjuntan a una entrada, a una ruta de entrada (columna) o a un vínculo de entrada para describir ese recurso.

A diferencia de los sistemas de etiquetado heredados, los aspectos de Knowledge Catalog se encapsulan directamente dentro de sus entradas principales o vínculos de entrada, lo que te permite realizar operaciones de lectura y escritura atómicas.

Los aspectos se usan en varias funciones:

  • Estructura técnica: El aspecto Schema describe las columnas de la tabla, los tipos de datos y las descripciones.
  • Contexto comercial: Los aspectos personalizados describen la propiedad, el cumplimiento y el estado del ciclo de vida.
  • Confianza operativa: Los aspectos de la calidad de los datos registran los resultados del análisis de reglas automatizadas y las puntuaciones de validación.
  • Gráficos de entidades no estructurados: El aspecto GraphProfile captura las entidades extraídas por IA y los bordes de relaciones de los archivos sin procesar.

Por ejemplo, puedes crear una instancia del tipo de aspecto ContactInfo con valores {"owner_name": "Alex", "email": "alex@example.com"} y adjuntarla a la entrada customer_orders.

Para obtener más información, consulta Aspectos.

Tipos de entrada

Un tipo de entrada (EntryType) es una plantilla de administración para crear entradas personalizadas. Aplica los estándares de calidad de los metadatos estableciendo los tipos de aspectos obligatorios que se deben adjuntar a una entrada de ese tipo.

Cuando creas una entrada de un tipo específico, Knowledge Catalog valida que todos los tipos de aspectos marcados como required en el tipo de entrada estén presentes y sean válidos.

Por ejemplo, puedes crear un tipo de entrada llamado CertifiedDataProduct que especifique los tipos de aspectos OwnerInfo y DataRetentionPolicy como obligatorios. Cualquier entrada nueva creada con este tipo debe incluir estos aspectos antes de que puedas guardarla.

Para obtener más información, consulta Tipos de entrada.

Vínculos de entrada y tipos de vínculos de entrada

Un vínculo de entrada (EntryLink) establece una relación semántica entre dos entradas de datos o entre columnas específicas dentro de las entradas. Cada vínculo de entrada es una instancia de un tipo de vínculo de entrada (EntryLinkType).

Los vínculos de entrada pueden ser direccionales o no direccionales:

  • Simétrica (no direccional): Son las relaciones en las que ambos lados son pares (por ejemplo, synonym, related o schema-join).
  • Asimétricas (direccionales): Son relaciones con una fuente y un destino explícitos (por ejemplo, definition, que vincula un término del glosario empresarial a una columna de la tabla).

También puedes conectar aspectos directamente a los vínculos de entrada (excepto los vínculos de schema-join). Esto te permite describir la relación en sí, como registrar las puntuaciones de confianza de la unión, las reglas de transformación o las notas de asignación.

Knowledge Catalog admite los siguientes tipos de vínculos integrados a entradas:

  • synonym: Conecta conceptos comerciales equivalentes o términos alternativos.
  • related: Conecta recursos con acoplamiento bajo en diferentes sistemas.
  • definition: Conecta las definiciones del glosario empresarial con columnas o entradas físicas.
  • schema-join: Conecta tablas que se pueden unir a lo largo de rutas de acceso de clave externa o esquema coincidentes.
Es el vínculo de entrada con las entradas, los aspectos y sus tipos vinculados. Es el vínculo de entrada con las entradas, los aspectos y sus tipos vinculados.
Figura 3. Vínculo de entrada con entradas, aspectos y sus tipos vinculados (haz clic para ampliar).

Para obtener más información, consulta la referencia de la API de REST de EntryLinks.

Glosarios y términos empresariales

Un glosario empresarial te permite establecer una taxonomía empresarial formal definiendo glosarios, categorías y términos comerciales.

Con los vínculos de entrada de tipo definition o synonym, puedes asignar términos comerciales directamente a entradas físicas y rutas de columna. Cuando los usuarios o los agentes de IA buscan en el catálogo con lenguaje natural, el motor de búsqueda resuelve estos términos comerciales para ubicar los recursos de datos físicos correctos.

Para obtener más información, consulta Administra glosarios de la empresa.

Fuentes Google Cloud compatibles

Knowledge Catalog ingiere automáticamente metadatos de las siguientes fuentes deGoogle Cloud . En el caso de algunos servicios, como AlloyDB para PostgreSQL y Cloud SQL, primero debes habilitar la integración de Knowledge Catalog para que se puedan ingerir los metadatos:

  • Analytics y lakehouse

    • Conjuntos de datos, tablas, vistas, modelos, rutinas, conexiones, conjuntos de datos vinculados y gráficos de BigQuery (vista previa)
    • Intercambios y fichas de BigQuery sharing (anteriormente Analytics Hub)
    • Repositorios de Dataform y recursos de código
    • Servicios, base de datos y tablas de Dataproc Metastore
    • Tablas del catálogo de REST de Iceberg (incluidos Google Cloud el catálogo de tiempo de ejecución de Lakehouse IRC, el IRC de Databricks Unity, el IRC de Data Catalog de AWS Glue y el IRC de Snowflake Horizon)

    • Tablas de Apache Hive

    • Tablas de Delta Lake de SAP Business Data Cloud (BDC)

    • Tablas de Apache Iceberg administradas por el catálogo de entornos de ejecución de Lakehouse

  • IA y aprendizaje automático

    • Modelos, conjuntos de datos, grupos de atributos, vistas de atributos y instancias de almacén en línea de Vertex AI
  • Inteligencia empresarial

    • Instancias de Looker (Google Cloud Core), paneles, elementos de paneles, Looks, proyectos de LookML, modelos, Exploraciones y vistas (versión preliminar)
  • Bases de datos

    • Instancias, clústeres y tablas de Bigtable (incluidos los detalles de la familia de columnas)
    • Instancias, bases de datos, tablas y vistas de Spanner
  • Transmisión y mensajería

    • Temas de Pub/Sub
  • Datos no estructurados

  • Bases de datos operativas

Para importar metadatos de una fuente externa a Knowledge Catalog, puedes usar conectores de Knowledge Catalog o una canalización de conectividad administrada. Para obtener más información, consulta Acerca de los conectores de Knowledge Catalog y Descripción general de la conectividad administrada.

Restricciones de proyecto y ubicación

Los recursos del catálogo en Knowledge Catalog se encuentran dentro de Google Cloud proyectos y ubicaciones geográficas específicos. Se aplican las siguientes restricciones de alcance:

Recurso Regla de ubicación Regla del proyecto
Entradas La ubicación de la entrada debe coincidir con la de su EntryType, o bien el EntryType debe ser global. Puede hacer referencia a tipos de entrada globales o del mismo proyecto.
Aspectos de las entradas El AspectType del aspecto debe almacenarse en la misma ubicación que la entrada, o bien el AspectType debe ser global. Puede hacer referencia a tipos de aspectos globales o del mismo proyecto.
Vínculos de entrada La ubicación del vínculo de entrada debe coincidir con su EntryLinkType, o bien el EntryLinkType debe ser global. Pueden vincular entradas que residen en diferentes proyectos dentro de la misma organización.
Tipos de entrada Se compone de tipos de aspectos almacenados en la misma ubicación que el tipo de entrada o tipos de aspectos que son global. Si un tipo de entrada hace referencia a tipos de aspectos personalizados, estos deben estar en el mismo proyecto y ubicación.

Feeds de cambios de metadatos

Knowledge Catalog puede transmitir eventos de cambio de metadatos casi en tiempo real con feeds de cambio de metadatos.

Un feed de cambios de metadatos publica notificaciones sobre la creación, actualización o eliminación de entradas en un tema de Pub/Sub que configures. Los clientes suscriptores pueden consumir estos eventos para automatizar flujos de trabajo operativos, como activar evaluaciones de calidad de los datos cuando cambia un esquema o actualizar los paneles de control de gobernanza descendentes.

Para obtener más información, consulta Acerca de los feeds de cambios de metadatos.

Precios

Knowledge Catalog usa el SKU de almacenamiento de metadatos para cobrar el volumen de metadatos almacenados. Para obtener más información, consulta Precios del Catálogo de conocimiento.

No se cobran los siguientes servicios:

  • Crear y administrar recursos del metamodelo del catálogo (tipos de entrada, tipos de aspecto, grupos de entrada, entradas y vínculos de entrada)
  • Llamadas a la API de búsqueda y búsquedas realizadas en la consola de Google Cloud

¿Qué sigue?

Guía de inicio rápido

Descubre recursos y adjunta metadatos de aspectos personalizados a una tabla de BigQuery.

Transferencia

Define tipos de entrada y transfiere metadatos personalizados desde bases de datos y canalizaciones externas.

Administración

Crea una taxonomía empresarial y asigna términos directamente a tablas y columnas físicas.

Discovery

Descubre recursos en Google Cloud y fuentes personalizadas con predicados de búsqueda.

Contexto de la IA

Recupera metadatos listos para LLM y contexto activo para fundamentar los agentes de IA generativa.

Migración

Migra plantillas de etiquetas, entradas personalizadas y flujos de trabajo a Knowledge Catalog.