Hospedar agentes de IA em recursos do Cloud Run

Esta página destaca casos de uso para hospedagem de agentes de IA no Cloud Run.

Agentes de IA são entidades de software autônomas que utilizam sistemas baseados em LLM para perceber, decidir e agir a fim de atingir objetivos. À medida que mais agentes autônomos são construídos, sua capacidade de se comunicar e colaborar torna-se crucial.

Para uma introdução aos agentes de IA, veja O que é um agente de IA.

Escolher um recurso do Cloud Run

Dependendo do seu design de agente, é possível executar o contêiner dele como um dos seguintes tipos de recursos do Cloud Run:

  • Serviços: Melhor para agentes sem estado, orientados a solicitações, que lidam com tráfego de usuários variável, se beneficiam do dimensionamento automático e podem reduzir a zero quando ociosos. Exemplos incluem APIs de chatbot e back-ends de API da Web.
  • Instâncias: Ideal para loops de agentes singleton dedicados, com estado e sempre ativos, que requerem comandos de estado de ciclo de vida semelhantes aos de máquinas virtuais. Por exemplo, agentes pessoais como OpenClaw e Hermes.
  • Pools de trabalhadores:ideais para executar frotas de agentes distribuídos em segundo plano que consomem tarefas de filas de mensagens, como Kafka ou Pub/Sub, e escalonam horizontalmente sem expor endpoints HTTP públicos.
  • Jobs: Ideal para fluxos de trabalho de agentes de execução completa, como avaliações em lote, pipelines de ingestão de dados em larga escala ou scripts de sincronização agendados.

Escolher seu framework de agente

Antes de implantar seu agente no Cloud Run, escolha e configure a estrutura do seu agente localmente ou em sua plataforma de desenvolvimento. Exemplos de frameworks de agentes incluem Kit de Desenvolvimento de Agente (ADK), Dify, LangGraph e n8n.

No Cloud Run, seu código normalmente é executado como um serviço serviço ou instância. Os dois tipos de recursos executam instâncias de contêiner em sandbox no mesmo ambiente de execução e se integram aos serviços do Google Cloud .

Agente de IA na arquitetura Cloud Run

Uma arquitetura típica de agente de IA implantada no Cloud Run pode envolver vários componentes do Google Cloud e de fora doGoogle Cloud. A arquitetura a seguir mostra um exemplo de implementação de um agente de IA como um serviço do Cloud Run para orquestrar um conjunto de tarefas assíncronas e fornecer informações por meio de várias interações de solicitação-resposta.

Os quatro componentes do agente de IA hospedado no Cloud Run.
Figura 1. Arquitetura de um agente de IA no Cloud Run.

O diagrama mostra estes elementos:

  • Plataforma de hospedagem: Um serviço Cloud Run é um endpoint de API escalável para a lógica principal do seu aplicativo. Ele gerencia com eficiência vários usuários simultâneos com escalonamento automático, rápido e sob demanda de instâncias. O Cloud Run oferece os seguintes benefícios:

    • Oferece suporte à execução de qualquer framework de agente para criar diferentes tipos de agentes e arquiteturas agênticas.
    • Suporte integrado para Identidade do Agente. Atribui uma identidade exclusiva e criptograficamente verificável ao seu agente para chamar APIs e ferramentas do Google Cloud e se conectar com segurança a outros agentes. Para saber mais, consulte Configurar recursos da plataforma do agente.
    • Integração integrada comAgent Registry. Designar os serviços implantados como um agente ou um servidor MCP para descoberta automática e mecanismos robustos de autenticação de agente para agente (A2A). Para saber mais, consulte Configurar recursos da plataforma do agente.
    • Permite conectar sua estrutura de agente a outros serviços. Você pode conectar seu agente a ferramentas próprias ou de terceiros implantadas no Cloud Run. Por exemplo, para ter visibilidade das tarefas e execuções do seu agente, implante e use ferramentas como Langfuse e Arize.
  • Interações com o agente: o Cloud Run é compatível com respostas HTTP de streaming para o usuário e WebSockets para interações em tempo real.

  • Modelos GenAI A camada de orquestração invoca modelos para capacidades de raciocínio. Esses modelos podem ser hospedados em serviços como os seguintes:

  • Memória Os agentes frequentemente precisam de memória para reter o contexto e aprender com interações passadas. Você pode utilizar os seguintes serviços:

  • Banco de dados de vetores: Para geração aumentada por recuperação (RAG) ou busca de dados estruturados, use um banco de dados de vetores para consultar informações de entidades específicas ou realizar uma busca vetorial em embeddings. Use a extensão pgvector com os seguintes serviços:

  • Ferramentas:o orquestrador usa ferramentas para realizar tarefas específicas e interagir com serviços, APIs ou sites externos. Isso inclui:

    • Protocolo de Contexto de Modelo (MCP): use esse protocolo padronizado para se comunicar com ferramentas externas executadas por um servidor MCP.
    • Utilitários básicos: cálculos matemáticos precisos, conversões de tempo ou outros utilitários semelhantes.
    • Chamada de API: faça chamadas para outras APIs internas ou de terceiros (acesso de leitura ou gravação).
    • Geração de imagens ou gráficos: crie conteúdo visual com rapidez e eficiência.
    • Automação de navegador e SO: Execute um sistema operacional headless ou gráfico completo dentro de instâncias de contêiner para permitir que o agente navegue na web, extraia informações de sites ou execute ações usando cliques e entrada de teclado.
    • Execução de código: execute código em um ambiente seguro com sandbox de várias camadas, com permissões mínimas ou nenhuma permissão do IAM.
    • Execução de código do Vertex AI Agent Engine: Execute código em ambientes sandbox seguros, isolados e gerenciados que suportam entrada e saída de arquivos, execução de código em menos de um segundo e memória de longa duração. É necessário criar pelo menos uma instância do mecanismo de agente da Vertex AI para usar esse recurso no Cloud Run.

A seguir