Esta página destaca los casos de uso para alojar agentes de IA en Cloud Run.
Los agentes de IA son entidades de software autónomas que utilizan sistemas basados en LLM para percibir, decidir y actuar con el fin de alcanzar objetivos. A medida que se desarrollan más agentes autónomos, su capacidad de comunicarse y colaborar se vuelve crucial.
Para una introducción a los agentes de IA, consulte ¿Qué es un agente de IA.
Elige un recurso de Cloud Run
Dependiendo del diseño de tu agente, puedes ejecutar tu contenedor de agente como uno de los siguientes tipos de recursos de Cloud Run:
- Servicios: Ideal para agentes sin estado, impulsados por solicitudes, que manejan tráfico de usuarios variable, se benefician del escalado automático y pueden escalar a cero cuando están inactivos. Algunos ejemplos son las API de chatbots y los sistemas backend de API web.
- Instancias: Son ideales para bucles de agentes singleton dedicados, con estado y siempre activos que requieren comandos de estado de ciclo de vida similares a los de las VM. Algunos ejemplos son los agentes personales como OpenClaw y Hermes.
- Grupos de trabajadores: Ideales para ejecutar flotas de agentes distribuidos en segundo plano que consumen tareas de colas de mensajes, como Kafka o Pub/Sub, y escalan horizontalmente sin exponer puntos finales HTTP públicos.
- Trabajos: Ideal para flujos de trabajo de agentes de ejecución completa, como evaluaciones por lotes, canalizaciones de transferencia de datos a gran escala o scripts de sincronización programados.
Elige tu framework de agente
Antes de implementar su agente en Cloud Run, seleccione y configure su marco de trabajo de agente localmente o en su plataforma de desarrollo. Algunos ejemplos de frameworks de agentes incluyen Kit de desarrollo de agentes (ADK), Dify, LangGraph y n8n.
En Cloud Run, su código normalmente se ejecuta como un servicio servicio o instancia. Ambos tipos de recursos ejecutan instancias de contenedores aislados en el mismo entorno de ejecución y se integran con Google Cloud services.
Agente de IA en arquitectura Cloud Run
Una arquitectura típica de agente de IA implementada en Cloud Run puede involucrar varios componentes de Google Cloud así como de fuera deGoogle Cloud. La siguiente arquitectura muestra un ejemplo de cómo implementar un agente de IA como un servicio de Cloud Run para orquestar un conjunto de tareas asíncronas y proporcionar información a través de múltiples interacciones de solicitud-respuesta.
En el diagrama se muestra lo siguiente:
Plataforma de alojamiento: Un servicio Cloud Run es un punto final de API escalable para la lógica central de su aplicación. Gestiona de forma eficiente a múltiples usuarios simultáneos mediante el escalado automático, bajo demanda y rápido de las instancias. Cloud Run ofrece los siguientes beneficios:
- Admite la ejecución de cualquier marco de agente para construir diferentes tipos de agentes y arquitecturas de agentes.
- Compatibilidad integrada con la identidad del agente Asigna una identidad única y criptográficamente verificable a tu agente para llamar a Google Cloud APIs y herramientas, y conectarse de forma segura con otros agentes. Para obtener más información, consulte Configurar las características de la plataforma del agente.
- Integración con Agent Registry Designa tus servicios implementados como agente o servidor de MCP para el descubrimiento automático y mecanismos de autenticación robustos de agente a agente (A2A). Para obtener más información, consulte Configurar las características de la plataforma del agente.
- Permite conectar su plataforma de agentes con otros servicios. Puedes conectar tu agente a herramientas de origen o de terceros implementadas en Cloud Run. Por ejemplo, para obtener visibilidad de las tareas y ejecuciones de su agente, puede implementar y utilizar herramientas como Langfuse y Arize.
Interacciones del agente: Cloud Run admite respuestas HTTP de transmisión al usuario y WebSockets para interacciones en tiempo real.
Modelos GenAI: La capa de orquestación llama a los modelos para capacidades de razonamiento. Estos modelos pueden alojarse en servicios, como los siguientes:
- API de Gemini para los modelos de IA generativa de Google.
- Puntos finales de Vertex AI para modelos personalizados u otros modelos base.
- Servicio de Cloud Run habilitado para GPU para tus propios modelos ajustados
Memoria: Los agentes a menudo necesitan memoria para conservar el contexto y aprender de las interacciones pasadas. Puedes usar los siguientes servicios:
- Memorystore para Redis para memoria a corto plazo.
- Firestore para la memoria a largo plazo, como almacenar el historial de conversaciones o recordar las preferencias del usuario basándose en datos sin procesar.
- Vertex AI Agent Engine Memory Bank para memoria personalizada a largo plazo. Esta función extrae automáticamente información del historial de conversaciones del usuario para recordar y actualizar sus preferencias con el tiempo. Tenga en cuenta que necesita crear al menos una instancia de Agent Engine para usar esta función con Cloud Run.
Base de datos vectorial: Para la Generación mejorada por recuperación (RAG) o la obtención de datos estructurados, utilice una base de datos vectorial para consultar información específica de entidades o realizar una búsqueda vectorial sobre embeddings. Utilice la extensión
pgvectorcon los siguientes servicios:Herramientas: El orquestador utiliza herramientas para realizar tareas específicas para interactuar con servicios externos, API o sitios web. Esto puede incluir lo siguiente:
- Protocolo de contexto del modelo (MCP): Usa este protocolo estandarizado para comunicarte con herramientas externas que se ejecutan a través de un servidor de MCP.
- Utilidades básicas: Cálculos matemáticos precisos, conversiones de tiempo o cualquier otra utilidad similar.
- Llamadas a la API: Realiza llamadas a otras APIs internas o de terceros (acceso de lectura o escritura).
- Generación de imágenes o gráficos: Cree contenido visual de forma rápida y eficaz.
- Automatización del navegador y el SO: Ejecuta un sistema operativo gráfico completo o sin interfaz gráfica dentro de instancias de contenedores para permitir que el agente navegue por la Web, extraiga información de sitios web o realice acciones con clics y entradas de teclado.
- Ejecución de código: Ejecutar código en un entorno seguro con aislamiento de múltiples capas, con permisos IAM mínimos o nulos.
- Ejecución de código de Vertex AI Agent Engine: Ejecuta código en entornos de zona de pruebas seguros, aislados y administrados que admiten entrada y salida de archivos, ejecución de código en menos de un segundo y memoria de larga duración. Ten en cuenta que debes crear al menos una instancia de Vertex AI Agent Engine para usar esta función en Cloud Run.
¿Qué sigue?
- Compila e implementa agentes en Cloud Run:
- Mira Crear agentes de IA en Cloud Run.
- Prueba el codelab para aprender a compilar e implementar una app con LangChain en Cloud Run.
- Aprende a implementar el Kit de desarrollo de agentes (ADK) en Cloud Run.
- Aprende cómo Crear y administrar instancias de Cloud Run.
- Prueba el codelab para usar un servidor de MCP en Cloud Run con un agente de ADK.
- Prueba el codelab para implementar tu agente de ADK en Cloud Run con GPU.
- Encuentra muestras de agentes listas para usar en Muestras del ADK.
- Aloja servidores del Protocolo de contexto del modelo (MCP) en Cloud Run.