🔥 Entre no nosso grupo e receba as melhores ofertas de tech Entrar agora →
MelhoresTech
Voltar
inteligencia-artificial

Gemini 3.8 Live: Google lança IAs de voz que raciocinam enquanto conversam e executam tarefas em segundo plano

Web Story
Gemini 3.8 Live: Google lança IAs de voz que raciocinam enquanto conversam e executam tarefas em segundo plano

O Google apresentou nesta terça-feira (15) dois novos modelos de inteligência artificial feitos para conversa por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. A proposta é resolver um incômodo comum dos assistentes falados, que costumam ficar em silêncio ou perder o fio da conversa quando precisam pesquisar algo ou acionar outro serviço. Agora, essas chamadas acontecem em segundo plano, enquanto o diálogo segue.

Os dois modelos têm funções diferentes. O 3.8 Live é a versão de escala, pensada para ser barata e rápida, com capacidade de interpretar o que a câmera mostra quase em tempo real e de reconhecer 97 idiomas, alternando entre eles sem configuração. Já o Extended Thinking mira problemas mais complexos: ele raciocina em várias etapas ao mesmo tempo em que fala, usa frases curtas de confirmação para mostrar que entendeu o pedido e vai narrando o andamento das tarefas mais longas.

Gráfico do Speech to Speech Index da Artificial Analysis com o Gemini 3.8 Live Extended Thinking em primeiro lugar

Como ele se sai nos testes

No índice de qualidade de fala da Artificial Analysis, o Extended Thinking marcou 82,6 pontos e ficou em primeiro, à frente do GPT-Live-1 Astra (81,5) e do Grok Voice Think Fast 2.0 (81,3) — uma vantagem apertada. O modelo mais leve, o 3.8 Live, aparece com 76 pontos, mas ficou em segundo lugar na Speech Agent Arena, ranking baseado na preferência de usuários. O Google também destaca 68,6% no τ-Voice e 35,1% no teste bancário da Sierra, que medem a capacidade de concluir tarefas por voz, além de 97,7% no Big Bench Audio.

Ranking de tarefas bancárias por voz da Sierra com o Gemini 3.8 Live Extended Thinking na liderança

Onde já está disponível

Para o público geral, o 3.8 Live passa a responder no Search Live, a busca por voz do Google, e o Extended Thinking alimenta o Gemini Live no app Gemini. No Workspace, o modelo com raciocínio aparece em recursos como Docs Live, Gmail Live e Keep Live para assinantes dos planos Google AI. Desenvolvedores podem usar os dois pela API Gemini e pelo Google AI Studio. Como nos lançamentos anteriores, todo áudio gerado sai com a marca d’água invisível SynthID, que permite identificar a origem sintética.

O movimento acirra a disputa com a OpenAI e a xAI pelo assistente de voz mais natural, uma frente que ganhou importância à medida que essas IAs deixam de só responder perguntas e passam a executar ações, como reservar serviços ou mexer em documentos, a partir de um pedido falado.



Gostou deste artigo?

-- -- votos

Você pode gostar também