A API Gemini Live permite interações de voz e vídeo em tempo real e de baixa latência com o Gemini. Ele processa fluxos contínuos de áudio, vídeo ou texto para fornecer respostas faladas imediatas e semelhantes às humanas. Isso cria uma experiência de conversa natural para os usuários. Os avatares dinâmicos oferecem a opção de interagir com um ícone semelhante a um humano que sincroniza com as respostas de fala, proporcionando uma experiência melhor e mais pessoal com os usuários.
Testar a API Gemini Live no Agent Studio
Exemplos de casos de uso
A API Gemini Live pode ser usada para criar agentes de voz e vídeo em tempo real para vários setores, incluindo:
Embaixadores corporativos da marca: representantes interativos da marca implantados em propriedades da Web corporativas ou aplicativos móveis, gerados com base em semelhanças de funcionários autorizados ou talentos pagos com liberações corporativas executadas.
E-commerce e varejo: assistentes de compras que oferecem recomendações personalizadas e agentes de suporte que resolvem problemas dos clientes.
Jogos: personagens não jogáveis (NPCs) interativos, assistentes de ajuda no jogo e tradução em tempo real do conteúdo do jogo.
Interfaces de última geração: experiências ativadas por voz e vídeo em robótica, óculos inteligentes e veículos.
Saúde: guias de navegação que ajudam na logística de instalações e cuidados.
Serviços financeiros: agentes de conversação que triam solicitações bancárias diárias.
Educação: mentores e acompanhantes de aprendizado de IA que oferecem instruções e feedback personalizados.
Principais recursos
A API Gemini Live oferece um conjunto abrangente de recursos para criar agentes de voz e vídeo robustos:
Alta qualidade do áudio: a API Gemini Live oferece fala natural e realista em vários idiomas.
Suporte multilíngue: converse em 24 idiomas disponíveis.
Interrupção: os usuários podem interromper o modelo a qualquer momento para interações responsivas.
Diálogo afetivo: adapta o estilo e o tom da resposta para corresponder à expressão da entrada do usuário.
Uso de ferramentas: integra ferramentas como chamada de função e Pesquisa Google para interações dinâmicas.
Transcrição de áudio: fornece transcrições de texto da entrada do usuário e da saída do modelo. Para transcrição como objetivo final, e não como um canal secundário de uma conversa, consulte Gemini 3.5 Transcribe.
Áudio proativo: permite controlar quando e em quais contextos o modelo responde.
Especificações técnicas
A tabela a seguir descreve as especificações técnicas da API Gemini Live:
| Categoria | Detalhes |
|---|---|
| Modalidades de entrada | Áudio (áudio PCM bruto de 16 bits, 16 kHz, little-endian), imagens/vídeo (JPEG 1 FPS), texto |
| Modalidades de saída | Áudio (áudio PCM bruto de 16 bits, 24 kHz, little endian), texto |
| Vídeo (avatares em tempo real) | Vídeo (mp4) |
| Protocolo | Conexão WebSocket com estado (WSS) |
Modelos compatíveis
Os seguintes modelos são compatíveis com a API Gemini Live. Selecione o modelo adequado com base nos requisitos de interação.
| ID do modelo | Disponibilidade | Caso de uso | Principais recursos |
|---|---|---|---|
gemini-3.8-live |
Disponibilidade geral | Recomendado. Agentes de voz de baixa latência. Oferece suporte à troca multilíngue integrada. |
|
gemini-live-2.5-flash-native-audio |
Disponibilidade geral | Recomendado. Agentes de voz de baixa latência. Oferece suporte a troca de idiomas e tom emocional sem problemas. |
|
gemini-3.5-transcribe-live-preview |
Visualizar | Somente conversão de voz em texto. Legendas instantâneas, transcrição por voz e transcrição de chamadas. Retorna texto, não áudio, então não mantém uma conversa. |
|
Primeiros passos
Selecione o guia que corresponde ao seu ambiente de desenvolvimento:
Tutorial do SDK de IA generativa
Conecte-se à API Gemini Live usando o SDK de IA generativa para criar um aplicativo multimodal em tempo real com um back-end em Python.
Tutorial do WebSocket
Conecte-se à API Gemini Live usando WebSockets para criar um aplicativo multimodal em tempo real com um front-end JavaScript e um back-end Python.
Tutorial do ADK
Crie um agente e use o streaming do Kit de Desenvolvimento de Agente (ADK) para ativar a comunicação por voz e vídeo.
Integrações com parceiros
Se você quiser fazer a integração com alguns dos nossos parceiros, essas plataformas já integraram a API Gemini Live ao protocolo WebRTC para simplificar o desenvolvimento de aplicativos de áudio e vídeo em tempo real.
Arquitetura de referência do LiveKit e do ADK
Para assistentes de voz avançados de nível de produção que exigem orquestração de sessão, roteamento e delegação multiagente sofisticados, é possível criar uma integração bidirecional de baixa latência usando o LiveKit (WebRTC) com a API Gemini Live pelo Kit de Desenvolvimento de Agente (ADK).
Essa arquitetura permite implantar um agente orquestrador que lida com a interação inicial do cliente e encaminha dinamicamente as solicitações para subagentes especializados (por exemplo, delegando contexto a um agente de reserva de voos ou de hotéis usando a orquestração transferAgent).
Para conhecer e implantar esse design de referência, consulte a implementação oficial do codebase de referência no GitHub.
