Visão geral da solução
O Google Cloud Cortex Framework oferece aceleradores de soluções que ajudam você a criar produtos de dados confiáveis e de alta qualidade, prontos para análises avançadas e casos de uso de agentes. O framework usa Google Cloudprodutos do Google, incluindo o BigQuery, o Dataform, o Knowledge Catalog e a Gemini Enterprise Agent Platform.
Os aceleradores de soluções do Cortex Framework estão disponíveis como módulos personalizáveis de código aberto que você implanta com segurança no seu próprio Google Cloud ambiente para criar, personalizar e estender rapidamente produtos de dados de sistemas de origem corporativos.
Ao simplificar a maneira como as equipes criam, orquestram e implantam, o Cortex Framework acelera o tempo de retorno do investimento e oferece uma base de alta fidelidade de análises corporativas confiáveis e casos de uso de agentes.
Fontes de dados com suporte
Os aceleradores de soluções do Cortex Framework estão disponíveis para as seguintes fontes de dados:
Principais componentes
O Cortex Framework consiste nos seguintes componentes de solução de alto nível:
Framework de criação e implantação
O framework de criação e implantação orquestra a transição de configurações locais para pipelines do Dataform e conjuntos de dados ativos do BigQuery. Ele é executado usando scripts de interface de linha de comando (CLI, na sigla em inglês) (cortex-build, cortex-deploy, cortex-build-and-deploy) com tecnologia de ferramentas padrão do Python (uv).
É possível executar esses scripts em vários ambientes:
- Máquinas de desenvolvimento local: para configuração inicial, personalização, testes e depuração.
- Google Cloud **Cloud Shell / estações de trabalho virtuais**: ambientes de desenvolvedor seguros e hospedados na nuvem.
- Pipelines de CI/CD: automatização de builds e implantações por sistemas como o Cloud Build ou o GitHub Actions para garantir a integração contínua.
O framework compila arquivos de configuração (como config.yaml e table_settings.yaml), analisa os esquemas dos recursos de dados de origem (incluindo colunas personalizadas) e gera dinamicamente o código JavaScript e SQLX do Dataform. O código é enviado para um repositório do Dataform em Google Cloud e fica imediatamente pronto para execução do pipeline.
Módulos de dados
Os **módulos de dados** fornecem ao framework de criação e implantação metadados de solução empacotados que definem a estrutura e os componentes dos pipelines de dados do Dataform. Há diferentes tipos de módulos:
- Módulos de base de dados: definem os conjuntos de dados que representam o estado mais recente das tabelas operacionais brutas. Eles padronizam tipos de dados, renomeiam campos de dados em termos comerciais legíveis por humanos, processam mudanças de dados e executam alinhamentos de fuso horário.
- Módulos de produtos de dados: definem os modelos analíticos criados com base no conteúdo do módulo de base de dados. Eles implementam regras de negócios complexas, KPIs, agregações e junções multifuncionais (por exemplo, combinando registros de vendas com taxas de câmbio) para expor conjuntos de dados limpos e prontos para consumo.
- Módulos do Data Catalog: definem os catálogos externos de lakehouse com suporte para referências de tabelas externas sem manifestos físicos.
Os módulos são de código aberto e personalizáveis, permitindo que você os adapte aos seus requisitos de negócios exclusivos.
Catálogos de dados externos
O Cortex Framework oferece suporte à integração direta com catálogos de dados externos usando os módulos do Data Catalog. Ao usar o catálogo de execução do Lakehouse, o framework pode consultar tabelas gerenciadas em data lakes externos ou compartilhamentos delta (como produtos de dados originados usando o SAP Business Data Cloud Connect para BigQuery) sem sobrecarga de cópia.
Isso permite que as organizações combinem o conteúdo entregue pelo Cortex Framework com produtos de dados externos, criando insights de negócios unificados sem armazenamento duplicado ou manutenção de pipeline.
Orquestração do Dataform
O Cortex Framework usa Dataform para gerenciar o ciclo de vida das transformações de dados. O Dataform oferece um ambiente sem servidor para criar, testar, controlar versões e programar pipelines SQL complexos no BigQuery.
Em vez de escrever SQL estático, o framework gera dinamicamente o código do Dataform durante a fase de criação para refletir sua configuração e personalizações específicas. Depois de preparado para o repositório de destino do Dataform em Google Cloud, é possível executar os pipelines gerados para materializar e preencher as tabelas e visualizações em conformidade.
Modelos de dados do BigQuery
Todos os dados processados pelo Cortex Framework são organizados e armazenados no BigQuery. O framework oferece suporte a:
- Tabelas e visualizações padrão do BigQuery: conjuntos de dados totalmente materializados ou virtuais do BigQuery otimizados com particionamento e clustering para melhorar o desempenho da consulta e controlar os custos.
- Fontes de dados federadas: consultas que abrangem conjuntos de dados externos, permitindo que você una o armazenamento do BigQuery a tabelas externas federadas.
- Catálogo de execução do Lakehouse: consulta direta e sem cópia de catálogos externos (como o compartilhamento delta) expostos como tabelas no BigQuery, com suporte para a criação de produtos de dados em várias fontes de dados.
Integração do Knowledge Catalog
O Knowledge Catalog atua como um catálogo unificado de governança e descoberta para todos os recursos de dados da sua empresa. O Cortex Framework é integrado nativamente ao Knowledge Catalog usando uma ferramenta de sincronização dedicada cortex-kc-sync.
Quando executada, essa ferramenta registra automaticamente os produtos de dados implantados no catálogo, importando nomes legíveis por humanos, descrições detalhadas de negócios e links de documentação. Ela vincula tabelas físicas do BigQuery a domínios de negócios lógicos, tornando os recursos de dados detectáveis para analistas de negócios, administradores de dados e agentes de IA, garantindo o rastreamento robusto da linhagem. Para mais informações, consulte Integração do Knowledge Catalog.
Arquitetura de dados
O Cortex Framework padroniza o processamento de dados no BigQuery. A arquitetura é organizada em três camadas de dados estruturadas e distintas que se alinham aos princípios da malha de dados corporativa, promovendo propriedade clara, alta reutilização e separação estrita das camadas de dados.
Sistema de origem
Os sistemas de origem são as origens dos seus dados da empresa. Eles podem incluir vários aplicativos, bancos de dados ou plataformas corporativas de onde os dados são extraídos. Para uma lista completa de fontes com suporte, consulte Fontes de dados com suporte.
Camada bruta
A camada bruta representa um conjunto de dados de zona de destino imutável no BigQuery para dados de origem, registros de captura de dados alterados (CDC) ou lotes processados por CDC. Embora armazene com frequência registros de CDC (por exemplo, do SAP ECC ou S/4HANA usando ferramentas de replicação como BigQuery Connector para SAP ou BigQuery Toolkit para SAP), ele foi projetado para representar qualquer formato bruto. Para fontes que não fornecem registros de CDC, como o Salesforce ou feeds de API externos, essa camada representa as extrações de lote completas ou payloads de eventos brutos exatamente como chegam. Essa camada alimenta a camada de base de dados.
Camada de base de dados
A camada de base de dados limpa, padroniza e conforma os dados de destino brutos em uma representação única e confiável dos dados de origem mais recentes. Ela mapeia tabelas brutas para estruturas conformadas, padroniza tipos de dados, otimiza o desempenho com particionamento e clustering, consolida esquemas para garantir a consistência e aumenta os recursos com anotações de metadados. Para fontes de captura de dados alterados (CDC), essa camada mescla registros recebidos de forma incremental para otimizar o desempenho e reduzir os custos de consulta. Para mais informações, consulte Base de dados.
Camada de produtos de dados
A camada de produtos de dados abriga recursos de dados prontos para consumo, projetados para a tomada de decisões de negócios. Ela aplica a lógica de negócios, renomeia campos de sistema complexos em termos comerciais legíveis por humanos, traduz códigos de status, realiza ajustes de fuso horário e moeda, agrega métricas e une dados em várias tabelas brutas. As tabelas e visualizações resultantes são otimizadas para consumo direto por painéis de BI, ferramentas de relatórios, pipelines de machine learning e plataformas de IA, como a Gemini Enterprise Agent Platform e os agentes de análise conversacional do BigQuery. Para mais informações, consulte Produtos de dados.
Como estender a solução
O Cortex Framework combina flexibilidade orientada à configuração com automação assistida por IA para simplificar a maneira de estender o cenário de dados. Se você estiver usando assistentes de codificação de IA autônomos para criar tabelas personalizadas ou escrever uma lógica de compilação personalizada para novas fontes de dados, o framework vai fornecer as ferramentas, o isolamento e os portões de segurança necessários para escalonar seus produtos de dados com segurança.
Framework de extensibilidade
O framework de extensibilidade oferece um método estruturado para personalizar a base de dados e criar novos produtos de dados. As principais capacidades incluem:
- Namespaces personalizados: isole suas mudanças em um diretório personalizado (por exemplo,
src/data_modules/custom_namespace/) para proteger suas personalizações contra substituições quando os pacotes principais do framework forem atualizados. - Configuração como código: registre novas fontes de dados, destinos e módulos personalizados diretamente no arquivo de configuração global
config/config.yaml. - Criadores de compilação personalizados: implemente classes de criadores Python personalizadas (
builder.py) nos seus módulos para automatizar a geração dinâmica de SQL, regras de limpeza personalizadas ou transformações específicas da origem durante a fase de compilação.
Para mais informações, consulte o Guia de extensibilidade.
Criador de produtos de dados de agentes
Para ajudar os desenvolvedores e analistas de negócios a estender o framework, o Cortex Framework oferece habilidades empacotadas. Essas habilidades orientam os assistentes de codificação de IA (como o Antigravity pareado com o Gemini) a:
- Inspecionar esquemas físicos: recupere nomes de colunas, tipos e descrições precisos diretamente das tabelas replicadas do Dicionário de dados (DDIC) do SAP sem alucinações.
- Gerar módulos de modelo: gere automaticamente namespaces, manifestos, configurações de tabelas, modelos SQLX/JS e anotações.
- Validar mudanças: execute regras de linting, auditorias de nomenclatura e verificações de compilação, melhorando a qualidade do código antes da implantação.
Para mais informações, consulte Recursos de agentes.
Próximas etapas
Tudo pronto para criar e implantar? Consulte os guias a seguir para preparar seu ambiente:
- Produtos de dados: consulte o catálogo de produtos de dados disponíveis.
- Base de dados: entenda as tabelas e os campos de base.
- Implantação de demonstração: implante o conteúdo da solução com dados de demonstração em minutos para conferir o Cortex Framework em ação rapidamente.
- Implantação de produção: siga as instruções detalhadas para configurar e implantar o Cortex Framework para seus dados corporativos.