Esta página destaca casos de uso para hospedagem de agentes de IA no Cloud Run.
Agentes de IA são entidades de software autônomas que utilizam sistemas baseados em LLM para perceber, decidir e agir a fim de atingir objetivos. À medida que mais agentes autônomos são construídos, sua capacidade de se comunicar e colaborar torna-se crucial.
Para uma introdução aos agentes de IA, veja O que é um agente de IA.
Escolher um recurso do Cloud Run
Dependendo do seu design de agente, é possível executar o contêiner dele como um dos seguintes tipos de recursos do Cloud Run:
- Serviços: Melhor para agentes sem estado, orientados a solicitações, que lidam com tráfego de usuários variável, se beneficiam do dimensionamento automático e podem reduzir a zero quando ociosos. Exemplos incluem APIs de chatbot e back-ends de API da Web.
- Instâncias: Ideal para loops de agentes singleton dedicados, com estado e sempre ativos, que requerem comandos de estado de ciclo de vida semelhantes aos de máquinas virtuais. Por exemplo, agentes pessoais como OpenClaw e Hermes.
- Pools de trabalhadores:ideais para executar frotas de agentes distribuídos em segundo plano que consomem tarefas de filas de mensagens, como Kafka ou Pub/Sub, e escalonam horizontalmente sem expor endpoints HTTP públicos.
- Jobs: Ideal para fluxos de trabalho de agentes de execução completa, como avaliações em lote, pipelines de ingestão de dados em larga escala ou scripts de sincronização agendados.
Escolher seu framework de agente
Antes de implantar seu agente no Cloud Run, escolha e configure a estrutura do seu agente localmente ou em sua plataforma de desenvolvimento. Exemplos de frameworks de agentes incluem Kit de Desenvolvimento de Agente (ADK), Dify, LangGraph e n8n.
No Cloud Run, seu código normalmente é executado como um serviço serviço ou instância. Os dois tipos de recursos executam instâncias de contêiner em sandbox no mesmo ambiente de execução e se integram aos serviços do Google Cloud .
Agente de IA na arquitetura Cloud Run
Uma arquitetura típica de agente de IA implantada no Cloud Run pode envolver vários componentes do Google Cloud e de fora doGoogle Cloud. A arquitetura a seguir mostra um exemplo de implementação de um agente de IA como um serviço do Cloud Run para orquestrar um conjunto de tarefas assíncronas e fornecer informações por meio de várias interações de solicitação-resposta.
O diagrama mostra estes elementos:
Plataforma de hospedagem: Um serviço Cloud Run é um endpoint de API escalável para a lógica principal do seu aplicativo. Ele gerencia com eficiência vários usuários simultâneos com escalonamento automático, rápido e sob demanda de instâncias. O Cloud Run oferece os seguintes benefícios:
- Oferece suporte à execução de qualquer framework de agente para criar diferentes tipos de agentes e arquiteturas agênticas.
- Suporte integrado para Identidade do Agente. Atribui uma identidade exclusiva e criptograficamente verificável ao seu agente para chamar APIs e ferramentas do Google Cloud e se conectar com segurança a outros agentes. Para saber mais, consulte Configurar recursos da plataforma do agente.
- Integração integrada comAgent Registry. Designar os serviços implantados como um agente ou um servidor MCP para descoberta automática e mecanismos robustos de autenticação de agente para agente (A2A). Para saber mais, consulte Configurar recursos da plataforma do agente.
- Permite conectar sua estrutura de agente a outros serviços. Você pode conectar seu agente a ferramentas próprias ou de terceiros implantadas no Cloud Run. Por exemplo, para ter visibilidade das tarefas e execuções do seu agente, implante e use ferramentas como Langfuse e Arize.
Interações com o agente: o Cloud Run é compatível com respostas HTTP de streaming para o usuário e WebSockets para interações em tempo real.
Modelos GenAI A camada de orquestração invoca modelos para capacidades de raciocínio. Esses modelos podem ser hospedados em serviços como os seguintes:
- API Gemini para os modelos de IA generativa do Google.
- Endpoints da Vertex AI para modelos personalizados ou outros modelos de fundação.
- Serviço do Cloud Run com GPU para seus próprios modelos refinados.
Memória Os agentes frequentemente precisam de memória para reter o contexto e aprender com interações passadas. Você pode utilizar os seguintes serviços:
- Memorystore para Redis para memória de curto prazo.
- Firestore para memória de longo prazo, como armazenar o histórico de conversas ou lembrar as preferências do usuário com base em dados brutos.
- Memory Bank do Vertex AI Agent Engine para memória personalizada de longo prazo. Essa funcionalidade extrai automaticamente informações do histórico de conversas do usuário para lembrar e atualizar suas preferências ao longo do tempo. Observe que você precisa criar pelo menos uma instância do Agent Engine para usar este recurso com o Cloud Run.
Banco de dados de vetores: Para geração aumentada por recuperação (RAG) ou busca de dados estruturados, use um banco de dados de vetores para consultar informações de entidades específicas ou realizar uma busca vetorial em embeddings. Use a extensão
pgvectorcom os seguintes serviços:Ferramentas:o orquestrador usa ferramentas para realizar tarefas específicas e interagir com serviços, APIs ou sites externos. Isso inclui:
- Protocolo de Contexto de Modelo (MCP): use esse protocolo padronizado para se comunicar com ferramentas externas executadas por um servidor MCP.
- Utilitários básicos: cálculos matemáticos precisos, conversões de tempo ou outros utilitários semelhantes.
- Chamada de API: faça chamadas para outras APIs internas ou de terceiros (acesso de leitura ou gravação).
- Geração de imagens ou gráficos: crie conteúdo visual com rapidez e eficiência.
- Automação de navegador e SO: Execute um sistema operacional headless ou gráfico completo dentro de instâncias de contêiner para permitir que o agente navegue na web, extraia informações de sites ou execute ações usando cliques e entrada de teclado.
- Execução de código: execute código em um ambiente seguro com sandbox de várias camadas, com permissões mínimas ou nenhuma permissão do IAM.
- Execução de código do Vertex AI Agent Engine: Execute código em ambientes sandbox seguros, isolados e gerenciados que suportam entrada e saída de arquivos, execução de código em menos de um segundo e memória de longa duração. É necessário criar pelo menos uma instância do mecanismo de agente da Vertex AI para usar esse recurso no Cloud Run.
A seguir
- Crie e implante agentes no Cloud Run:
- Assista Crie agentes de IA no Cloud Run.
- Teste o codelab para aprender a criar e implantar um app LangChain no Cloud Run.
- Saiba como implantar o Kit de Desenvolvimento de Agente (ADK) no Cloud Run.
- Saiba como criar e gerenciar instâncias do Cloud Run.
- Teste o codelab para usar um servidor MCP no Cloud Run com um agente do ADK.
- Experimente o codelab para implantar seu agente ADK no Cloud Run com GPU.
- Encontre exemplos de agentes prontos para uso em Exemplos do ADK.
- Hospedar servidores do Protocolo de Contexto de Modelo (MCP) no Cloud Run.