O Google apresentou nesta terça-feira (15) dois novos modelos de inteligência artificial feitos para conversa por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. A proposta é resolver um incômodo comum dos assistentes falados, que costumam ficar em silêncio ou perder o fio da conversa quando precisam pesquisar algo ou acionar outro serviço. Agora, essas chamadas acontecem em segundo plano, enquanto o diálogo segue.
Os dois modelos têm funções diferentes. O 3.8 Live é a versão de escala, pensada para ser barata e rápida, com capacidade de interpretar o que a câmera mostra quase em tempo real e de reconhecer 97 idiomas, alternando entre eles sem configuração. Já o Extended Thinking mira problemas mais complexos: ele raciocina em várias etapas ao mesmo tempo em que fala, usa frases curtas de confirmação para mostrar que entendeu o pedido e vai narrando o andamento das tarefas mais longas.

Como ele se sai nos testes
No índice de qualidade de fala da Artificial Analysis, o Extended Thinking marcou 82,6 pontos e ficou em primeiro, à frente do GPT-Live-1 Astra (81,5) e do Grok Voice Think Fast 2.0 (81,3) — uma vantagem apertada. O modelo mais leve, o 3.8 Live, aparece com 76 pontos, mas ficou em segundo lugar na Speech Agent Arena, ranking baseado na preferência de usuários. O Google também destaca 68,6% no τ-Voice e 35,1% no teste bancário da Sierra, que medem a capacidade de concluir tarefas por voz, além de 97,7% no Big Bench Audio.

Onde já está disponível
Para o público geral, o 3.8 Live passa a responder no Search Live, a busca por voz do Google, e o Extended Thinking alimenta o Gemini Live no app Gemini. No Workspace, o modelo com raciocínio aparece em recursos como Docs Live, Gmail Live e Keep Live para assinantes dos planos Google AI. Desenvolvedores podem usar os dois pela API Gemini e pelo Google AI Studio. Como nos lançamentos anteriores, todo áudio gerado sai com a marca d’água invisível SynthID, que permite identificar a origem sintética.
O movimento acirra a disputa com a OpenAI e a xAI pelo assistente de voz mais natural, uma frente que ganhou importância à medida que essas IAs deixam de só responder perguntas e passam a executar ações, como reservar serviços ou mexer em documentos, a partir de um pedido falado.
