Visão geral da API Gemini Live

A API Gemini Live permite interações de voz e vídeo em tempo real e de baixa latência com o Gemini. Ele processa fluxos contínuos de áudio, vídeo ou texto para fornecer respostas faladas imediatas e semelhantes às humanas. Isso cria uma experiência de conversa natural para os usuários. Os avatares dinâmicos oferecem a opção de interagir com um ícone semelhante a um humano que sincroniza com as respostas de fala, proporcionando uma experiência melhor e mais pessoal com os usuários.

Testar a API Gemini Live no Agent Studio

Exemplos de casos de uso

A API Gemini Live pode ser usada para criar agentes de voz e vídeo em tempo real para vários setores, incluindo:

  • Embaixadores corporativos da marca: representantes interativos da marca implantados em propriedades da Web corporativas ou aplicativos móveis, gerados com base em semelhanças de funcionários autorizados ou talentos pagos com liberações corporativas executadas.

  • E-commerce e varejo: assistentes de compras que oferecem recomendações personalizadas e agentes de suporte que resolvem problemas dos clientes.

  • Jogos: personagens não jogáveis (NPCs) interativos, assistentes de ajuda no jogo e tradução em tempo real do conteúdo do jogo.

  • Interfaces de última geração: experiências ativadas por voz e vídeo em robótica, óculos inteligentes e veículos.

  • Saúde: guias de navegação que ajudam na logística de instalações e cuidados.

  • Serviços financeiros: agentes de conversação que triam solicitações bancárias diárias.

  • Educação: mentores e acompanhantes de aprendizado de IA que oferecem instruções e feedback personalizados.

Principais recursos

A API Gemini Live oferece um conjunto abrangente de recursos para criar agentes de voz e vídeo robustos:

  • Alta qualidade do áudio: a API Gemini Live oferece fala natural e realista em vários idiomas.

  • Suporte multilíngue: converse em 24 idiomas disponíveis.

  • Interrupção: os usuários podem interromper o modelo a qualquer momento para interações responsivas.

  • Diálogo afetivo: adapta o estilo e o tom da resposta para corresponder à expressão da entrada do usuário.

  • Uso de ferramentas: integra ferramentas como chamada de função e Pesquisa Google para interações dinâmicas.

  • Transcrição de áudio: fornece transcrições de texto da entrada do usuário e da saída do modelo. Para transcrição como objetivo final, e não como um canal secundário de uma conversa, consulte Gemini 3.5 Transcribe.

  • Áudio proativo: permite controlar quando e em quais contextos o modelo responde.

Especificações técnicas

A tabela a seguir descreve as especificações técnicas da API Gemini Live:

Categoria Detalhes
Modalidades de entrada Áudio (áudio PCM bruto de 16 bits, 16 kHz, little-endian), imagens/vídeo (JPEG 1 FPS), texto
Modalidades de saída Áudio (áudio PCM bruto de 16 bits, 24 kHz, little endian), texto
Vídeo (avatares em tempo real) Vídeo (mp4)
Protocolo Conexão WebSocket com estado (WSS)

Modelos compatíveis

Os seguintes modelos são compatíveis com a API Gemini Live. Selecione o modelo adequado com base nos requisitos de interação.

ID do modelo Disponibilidade Caso de uso Principais recursos
gemini-3.8-live Disponibilidade geral Recomendado. Agentes de voz de baixa latência. Oferece suporte à troca multilíngue integrada.
  • Áudio nativo
  • Transcrição de áudio
  • Detecção de atividade de voz
  • Computação afetiva
  • Áudio proativo
  • Uso de ferramentas
  • Avatar em tempo real
gemini-live-2.5-flash-native-audio Disponibilidade geral Recomendado. Agentes de voz de baixa latência. Oferece suporte a troca de idiomas e tom emocional sem problemas.
  • Áudio nativo
  • Transcrição de áudio
  • Detecção de atividade de voz
  • Computação afetiva
  • Áudio proativo
  • Uso de ferramentas
gemini-3.5-transcribe-live-preview Visualizar Somente conversão de voz em texto. Legendas instantâneas, transcrição por voz e transcrição de chamadas. Retorna texto, não áudio, então não mantém uma conversa.
  • Transcrição provisória e final
  • Detecção automática de idioma com troca de código
  • Carimbos de data/hora no nível do enunciado
  • Tendência de vocabulário personalizado

Primeiros passos

Selecione o guia que corresponde ao seu ambiente de desenvolvimento:

Recomendado para facilitar o uso

Conecte-se à API Gemini Live usando o SDK de IA generativa para criar um aplicativo multimodal em tempo real com um back-end em Python.

Controle de protocolo bruto

Conecte-se à API Gemini Live usando WebSockets para criar um aplicativo multimodal em tempo real com um front-end JavaScript e um back-end Python.

Kit de desenvolvimento de agente

Crie um agente e use o streaming do Kit de Desenvolvimento de Agente (ADK) para ativar a comunicação por voz e vídeo.

Integrações com parceiros

Se você quiser fazer a integração com alguns dos nossos parceiros, essas plataformas já integraram a API Gemini Live ao protocolo WebRTC para simplificar o desenvolvimento de aplicativos de áudio e vídeo em tempo real.

Arquitetura de referência do LiveKit e do ADK

Para assistentes de voz avançados de nível de produção que exigem orquestração de sessão, roteamento e delegação multiagente sofisticados, é possível criar uma integração bidirecional de baixa latência usando o LiveKit (WebRTC) com a API Gemini Live pelo Kit de Desenvolvimento de Agente (ADK).

Essa arquitetura permite implantar um agente orquestrador que lida com a interação inicial do cliente e encaminha dinamicamente as solicitações para subagentes especializados (por exemplo, delegando contexto a um agente de reserva de voos ou de hotéis usando a orquestração transferAgent).

Para conhecer e implantar esse design de referência, consulte a implementação oficial do codebase de referência no GitHub.